arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-12 至 2026-05-12 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 17 篇

2602.04712 2026-05-12 cs.CV cs.AI eess.IV 89%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 跨模态检索 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19115 2026-05-12 cs.CV 87%

Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?

生成巨人,检索弱者:为何多模态大语言模型在多模态检索中表现不佳?

Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) Tencent Inc(腾讯公司) Zhongguancun Academy(中关村学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV

AI总结 研究揭示多模态大语言模型在多模态检索中表现不佳的原因,通过稀疏自编码器分析发现其表示空间主要由文本语义构成,视觉语义不足,导致检索性能下降,提出ReAlign方法提升检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 86%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV 85%

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09579 2026-05-12 cs.LG cs.AI 83%

Biosignal Fingerprinting: A Cross-Modal PPG-ECG Foundation Model

生物信号指纹:一种跨模态PPG-ECG基础模型

Zhangdaihong Liu, Chang Liu, Fenglin Liu, Yixuan Chen, Yang Yang, David A. Clifton, Xiao Gu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津苏浙先进研究中心) School of Public Health, Shanghai Jiao Tong University(上海交通大学公共卫生学院)

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出生物信号指纹,通过跨模态基础模型M2AE生成紧凑且可迁移的心血管状态表示,实现无需重新训练的多任务应用,在多个任务中表现出色。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09418 2026-05-12 cs.CV cs.RO 83%

MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition

MAG-VLAQ:多模态空-地查询聚合用于跨视角地点识别

Zhengyi Xu, Yuhang Ming, Zhihao Zhan, Hanyu Zhu, Javier Civera, Wanzeng Kong

机构 * Hangzhou Dianzi University(杭州电子科技大学) TopXGun Robotics(TopXGun机器人) University of Zaragoza(萨拉戈萨大学)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MAG-VLAQ框架,通过预训练基础模型提取多模态特征并融合,提升空地跨视角地点识别性能,实验表明在KITTI360-AG数据集上性能提升显著。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 81%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10253 2026-05-12 cs.CR cs.AI 79%

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05955 2026-05-12 cs.DC 78%

Multi-Modal Style Transfer-based Prompt Tuning for Efficient Federated Domain Generalization

基于多模态风格迁移的提示微调的高效联邦领域泛化

Yuliang Chen, Xi Lin, Jun Wu, Xiangrui Cai, Qiaolun Zhang, Xichun Fan, Jiapeng Xu, Xiu Su

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文提出FaST-PT框架,通过多模态风格迁移和双提示模块实现高效联邦领域泛化,提升跨领域适应能力。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(25): 20427-20435, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08997 2026-05-12 eess.SP 71%

SEM-RAG: Structure-Preserving Multimodal Graph Compilation and Entropy-Guided Retrieval for Telecommunication Standards

SEM-RAG:结构保持的多模态图编译与熵引导检索用于电信标准

Yuzhi Yang, Lina Bariah, Yuhuan Lu, Hang Zou, Mérouane Debbah

专题命中 跨模态检索 :multimodal(title)

AI总结 本文提出SEM-RAG框架,通过结构保持编译和熵引导检索提升电信标准文档检索性能,实验显示其在表格和公式密集型问题上表现优异,准确率高达94.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13710 2026-05-12 cs.CV 70%

SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs

SLQ:通过共享潜在查询桥接模态以实现冻结MLLMs的检索

Haoran Lou, Ziyan Liu, Chunxiao Fan, Yuexin Wu, Yue Ming, Hao Wu, Kai Zuo, Yibo Chen, Xu Tang

机构 * School of Electronic Engineering, Beijing University of Posts(北京邮电大学电子工程学院) Xiaohongshu Inc., China(小红书公司)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 SLQ通过冻结MLLMs的主干,引入共享潜在查询提升多模态检索性能,实验显示其在多个基准上表现优异。

Comments Accepted to ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 62%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI 62%

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10510 2026-05-12 cs.LG cs.AI 57%

CMKL: Modality-Aware Continual Learning for Evolving Biomedical Knowledge Graphs

CMKL:面向演变生物医学知识图谱的模态感知持续学习

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Qixin Zhang, Yongcheng Jing, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业部门) King Abdullah University of Science and Technology(卡塔尔科技大学) School of Computing and Information Systems(计算与信息系统学院) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) Jilin University(吉林大学) School of Computing Technologies(计算技术学院) RMIT University(皇家墨尔本理工大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 CMKL通过混合专家路由融合结构、文本和分子信息,利用EWC和K-means多样化重放缓冲区保护已有知识,在生物医学持续学习任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09392 2026-05-12 cs.CV 57%

HyNeuralMap: Hyperbolic Mapping of Visual Semantics to Neural Hierarchies

HyNeuralMap:视觉语义到神经层次的双曲映射

Zihan Ma, Tian Xia, Kexin Wang, Xiao Li, Xiaowei He, Yudan Ren

机构 * School of Electronic Information (School of Artificial Intelligence), the Xi’an Key Laboratory of Radiomics and Intelligent Perception, Northwest University(电子信息学院(人工智能学院)、西安放射组学与智能感知重点实验室、西北大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出HyNeuralMap框架,利用双曲洛伦兹模型将视觉语义映射到共享的跨被试神经层次,通过双曲空间的负曲率捕捉层次化语义结构,实验表明其在多标签预测和跨模态检索中优于欧几里得基线。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 57%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08421 2026-05-12 cs.CV 57%

Beyond Bag-of-Patches: Learning Global Layout via Textual Supervision for Late-Interaction Visual Document Retrieval

超越图像块:通过文本监督学习全局布局用于晚期交互视觉文档检索

Pascal Tilli, Mohsen Mesgar

机构 * University of Stuttgart(斯图加特大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过文本监督学习文档全局布局,改进视觉文档检索的晚期交互架构,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏