arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3437 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3437 篇

2604.14363 2026-08-11 cs.CL cs.AI cs.CV 版本更新 82%

The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models

语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争

Akshay Paruchuri, Ishan Chatterjee, Henry Fuchs, Ehsan Adeli, Piotr Didyk

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) USI Lugano(卢加诺大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。

Comments 37 pages, 8 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01543 2026-08-04 cs.AI cs.CL cs.CV cs.IR 新提交 82%

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

V-Mem:面向多模态智能体长期记忆的模态路由检索

Dingyi Kang, Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。

Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00877 2026-08-04 cs.LG 新提交 82%

GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs

GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法

Xuechen Li

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00623 2026-08-04 cs.LG 新提交 82%

Towards Effective Federated Multimodal Graph Learning via Navigating Multifaceted Heterogeneity

面向有效联邦多模态图学习的多层面异质性导航方法

Yinlin Zhu, Di Wu, Yi Zhang, Xunkai Li, Wang Luo, Wei-Jin Huang, Miao Hu, Guocong Quan

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对联邦多模态图学习的多层面异质性问题,本文提出FedTCR算法,通过两阶段范式与拓扑感知跨模态路由机制,在7个领域的图中心与模态中心任务上优于现有最优基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26720 2026-08-03 cs.IR 版本更新 82%

CaIRec: Calibrated Modality Imputation for Incomplete Multimodal Recommendation

CaIRec:面向不完整多模态推荐的校准模态补全方法

Ruiyu Liu, Xiaohao Liu, Miaomiao Cai, Yunshan Ma, See-Kiong Ng

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文针对多模态推荐中模态缺失导致的跨模态结构失真与偏好适应差距问题,提出两阶段框架CaIRec,经多组实验验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05927 2026-07-08 cs.IR cs.AI cs.CL cs.CV 新提交 82%

CMDR: Contextual Multimodal Document Retrieval

CMDR:上下文多模态文档检索

Ryota Tanaka, Taku Hasegawa, Kyosuke Nishida

机构 * Human Informatics Labs.(人文信息实验室) NTT, Inc.(日本NTT公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态文档检索,提出CMDR-Embed框架联合编码页面纳入文档上下文,引入CMCL对比学习目标训练,实验证明该框架显著优于非上下文嵌入,凸显上下文感知多模态嵌入对文档检索的重要性。

Comments Accepted by ECCV 2026; project page: https://cmdr-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16494 2026-07-07 cs.CL cs.AI cs.CV 新提交 82%

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

迷失在末尾:多模态检索增强问答中的首因偏差

Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04836 2026-07-07 cs.IR 版本更新 82%

Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval

超越文本:为多模态电子商务检索对齐视觉与语言

Qujiaheng Zhang, Guangyue Xu, Fengjie Li

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22823 2026-06-23 cs.LG q-bio.QM 新提交 82%

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28641 2026-06-08 cs.IR 版本更新 82%

Subtraction Gets You More: Gap-Aware Retrieval for Multimodal Multi-Hop QA

减法让你获得更多:面向多模态多跳问答的差距感知检索

Sunah O, Jay-Yoon Lee

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多模态多跳问答中的证据集补全和序列池构建任务,提出GRAIL框架,通过隐式查询重写和上下文减法查询引导,解决语义锚定问题,实现组合跨模态推理,在MultimodalQA上获得40.3%的宏平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04240 2026-06-04 cs.CV cs.AI cs.CL 82%

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述

Jingbiao Mei

机构 * University of Cambridge(剑桥大学) Cambridge United Kingdom(剑桥英国)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。

Comments MDR Challenge Report at WWW2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29900 2026-05-29 cs.LG cs.IT math.IT 82%

OVA-IB: One vs All Information Bottleneck for Multi-Modal Alignment

OVA-IB:用于多模态对齐的一对多信息瓶颈

Tianchao Li, Shujian Yu, Xinrui Zu, Zhaolong Wei, Jeremy Gummeson, Jack C. P. Cheng, Robert Jenssen

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) UiT – The Arctic University of Norway(挪威北极大学) University of Copenhagen(哥本哈根大学) Norwegian Computing Center(挪威计算中心) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 提出基于信息瓶颈的一对多对齐框架OVA-IB,通过充分性对比下界和最小性正则化实现任意数量模态的对齐,在分类、回归和跨模态检索任务中表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29628 2026-05-29 cs.SD cs.AI cs.CL cs.LG eess.AS 82%

COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

COMET:音频-文本多模态对比嵌入中模态间隙的概念空间剖析

Yonggang Zhu, Liting Gao, Aidong Men, Wenwu Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Centre for Vision, Speech, and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出COMET框架,通过PLS-SVD分解揭示CLAP模型中模态间隙主要由少数共享概念轴贡献,并基于谱截断方法无训练地缓解间隙,实现零样本音频字幕接近全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02513 2026-05-20 cs.LG cond-mat.mtrl-sci 82%

Learning ORDER-Aware Multimodal Representations for Composite Materials Design

学习有序的多模态表示以进行复合材料设计

Xinyao Li, Hangwei Qian, Jingjing Li, Lei Zhu, Ivor Tsang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学) A*STAR CFAR(新加坡A*STAR CFAR)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本研究提出了一种基于有序性的多模态预训练框架ORDER,用于复合材料设计,通过整合异构数据源来捕捉纤维分布,从而在连续设计空间中实现有效的属性预测和微结构生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13277 2026-05-14 cs.CL cs.AI cs.CV cs.IR cs.LG 82%

Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation

以效用为导向的多模态证据选择用于多模态检索增强生成

Weiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang, Ziyi Huang

机构 * Arizona State University(亚利桑那州立大学) Texas A&M University(德克萨斯大学) Morgan Stanley(摩根大通)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出以信息论视角重构多模态证据选择,定义证据效用为模型输出分布的信息增益,通过引入潜在的证据有效性概念,提出无需训练的代理加速框架,实验证明在MRAG-Bench和Visual-RAG上优于现有RAG基线并降低计算成本。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11864 2026-05-13 cs.IR cs.AI cs.CV cs.MM 82%

Very Efficient Listwise Multimodal Reranking for Long Documents

非常高效的长文档多模态重排序方法

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(马杰拉技术研究院(MTRI))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出ZipRerank,通过轻量级查询-图像早期交互机制和单次前向传递消除自回归解码,实现高效多模态重排序,实验表明其在MMDocIR基准上性能优异且显著降低LLM推理延迟。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01163 2026-05-05 cs.IR cs.LG 82%

Multimodal Data Curation Through Ranked Retrieval

通过排序检索进行多模态数据整理

Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani, Tomo Kanazawa, Ramani Akkati, Shaan Jain, Andrew Mathau

机构 * NVIDIA

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出通过优化训练对和嵌入模型来提升多模态检索对齐,利用对称核子采样和专家嵌入引擎减少模态驱动的分离,有效缩小模态差距。

Comments ICLR DATA-FM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM 82%

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21893 2026-04-22 cs.LG 82%

Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings

打破幻觉:基于共识的生成对抗多模态嵌入中对抗性幻觉的缓解

Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(隆德大学) Google DeepMind(谷歌DeepMind)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种任务无关的缓解机制,利用生成模型恢复多模态嵌入的自然对齐,通过生成采样策略和共识聚合方案提升防御效果,实验显示其显著降低对抗性幻觉攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05268 2026-04-09 cs.CV cs.AI cs.CL 82%

Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking

Region-R1: 增强多模态重排序的查询侧区域裁剪

Chan-Wei Hu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Region-R1通过在重排序阶段引入区域裁剪机制,提升多模态重排序的鲁棒性,实验表明其在E-VQA和InfoSeek基准上显著提升召回率。

Comments 12 pages, 4 figures, accepted to ACL 2026 Findings, code available at https://github.com/taco-group/Region-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06156 2026-04-08 cs.CV cs.AI cs.CL 82%

MMEmb-R1: Reasoning-Enhanced Multimodal Embedding with Pair-Aware Selection and Adaptive Control

MMEmb-R1: 基于推理增强的多模态嵌入与配对感知选择及自适应控制

Yuchi Wang, Haiyang Yu, Weikang Bian, Jiefeng Long, Xiao Liang, Chao Feng, Hongsheng Li

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMEmb-R1框架,通过引入配对感知推理选择和强化学习,解决多模态嵌入中推理与对比监督不匹配及推理冗余的问题,实验显示其在MMEB-V2基准上达到71.2分,参数更少且推理效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29796 2026-04-01 eess.SP 82%

JEPA-MSAC: A Joint-Embedding Predictive Architecture for Multimodal Sensing-Assisted Communications

JEPA-MSAC:一种联合嵌入预测架构用于多模态传感辅助通信

Can Zheng, Jiguang He, Guofa Cai, Nannan Li, Mehdi Bennis, Henk Wymeersch, Merouane Debbah

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出JEPA-MSAC框架,通过联合嵌入预测架构实现多模态传感辅助通信的自监督学习,支持多任务预测并降低适应成本。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 82%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13537 2026-03-17 cs.IR cs.LG 82%

AMES: Approximate Multi-modal Enterprise Search via Late Interaction Retrieval

AMES:基于晚期交互检索的近似多模态企业搜索

Tony Joseph, Carlos Pareja, David Lopes Pegna, Abhishek Singh

机构 * Apple(苹果公司)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 AMES通过晚期交互检索架构实现多模态企业搜索,无需架构重设计,利用多向量编码器将文本、图像和视频嵌入共享空间,实验显示其在可扩展的Solr系统中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13061 2026-03-03 cs.CL cs.AI cs.CV cs.LG 82%

Robust Adaptation of Large Multimodal Models for Retrieval Augmented Hateful Meme Detection

鲁棒适应大规模多模态模型用于检索增强的仇恨表情包检测

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种鲁棒适应框架,用于提升大规模多模态模型在检索增强的仇恨表情包检测中的性能与泛化能力,同时提高模型的可解释性。

Comments EMNLP 2025 Main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00500 2026-03-03 cs.RO 82%

Zero-Shot Robotic Manipulation via 3D Gaussian Splatting-Enhanced Multimodal Retrieval-Augmented Generation

通过3D高斯点云增强的多模态检索增强生成实现零样本机器人操作

Zilong Xie, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yuan Xie

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出RobMRAG框架,通过3D高斯点云增强多模态检索增强生成,提升零样本机器人操作的泛化能力和可解释性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14245 2026-03-02 cs.IR 82%

XR: Cross-Modal Agents for Composed Image Retrieval

XR:跨模态代理用于组合图像检索

Zhongyu Yang, Wei Pang, Yingfang Yuan

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升

Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22278 2026-02-27 cs.IR cs.LG 82%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract)

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17584 2026-02-20 cs.LG 82%

Canonicalizing Multimodal Contrastive Representation Learning

规范多模态对比表示学习

Sharut Gupta, Sanyam Kansal, Stefanie Jegelka, Phillip Isola, Vikas Garg

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

AI总结 研究通过正交映射统一多模态对比模型的表示空间,实现跨模态的一致性对齐。

Comments 78 pages, 57 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16876 2026-02-20 cs.LG stat.ML 82%

ML-driven detection and reduction of ballast information in multi-modal datasets

基于机器学习的多模态数据集中的冗余信息检测与减少

Yaroslav Solovko

机构 * Independent Researcher(独立研究者)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出了一种多模态框架,用于检测和减少数据集中的冗余信息,通过多种方法整合信号,实现特征空间的高效修剪,提升机器学习效率。

Comments 20 pages, 27 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏