arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2604.27934 2026-05-01 cs.AI cs.CL 86%

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27600 2026-05-01 cs.IR 85%

Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG

净化多模态检索:用于RAG的片段级证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17765 2026-05-01 q-bio.QM cs.AI cs.CV 84%

Grounded Multimodal Retrieval-Augmented Drafting of Radiology Impressions Using Case-Based Similarity Search

基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成

Himadri S Samanta

机构 * Independent AI Researcher(独立AI研究员)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 79%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25711 2026-05-01 cs.SE cs.AI 79%

Learning Generalizable Multimodal Representations for Software Vulnerability Detection

学习通用的多模态表示以进行软件漏洞检测

Zeming Dong, Yuejun Guo, Qiang Hu, Yao Zhang, Maxime Cordy, Hao Liu, Mike Papadakis, Yongqiang Lyu

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultiVul框架,通过双相似性学习和一致性正则化对代码和注释进行多模态对齐,提升漏洞检测的泛化能力,实验表明在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19143 2026-05-01 cs.AI cs.CR cs.CV 62%

Imitation Game for Adversarial Disillusion with Chain-of-Thought Reasoning in Generative AI

对抗性欺骗的模仿游戏:生成AI中的链式推理

Ching-Chun Chang, Fan-Yun Chen, Shih-Hong Gu, Kai Gao, Hanrui Wang, Isao Echizen

机构 * Information and Society Research Division, National Institute of Informatics(信息与社会研究部,国立信息研究所) Department of Information Engineering and Computer Science, Feng Chia University(信息工程与计算机科学系,逢甲大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于模仿游戏的对抗性欺骗防御框架,利用链式推理生成多模态代理,有效对抗生成AI中的演绎和归纳欺骗攻击。

Journal ref in IEEE Access, vol. 13, pp. 95085-95093, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27252 2026-05-01 cs.DB 50%

Unified Data Discovery across Query Modalities and User Intents

跨查询模态和用户意图的统一数据发现

Tingting Wang, Shixun Huang, Zhifeng Bao, J. Shane Culpepper, Shazia Sadiq, Volkan Dedeoglu, Reza Arablouei

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出UniDisc框架,支持自然语言和表格查询,统一处理多样用户意图,通过上下文信号学习鲁棒表征,实现在不同数据发现场景中的统一相关性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏