arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3437 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3437 篇

2511.13415 2026-05-12 cs.IR cs.CL cs.CV 85%

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13942 2026-04-30 cs.CV cs.AI 85%

Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning

glance-or-gaze: 通过强化学习激励大 multimodal 模型适应性聚焦搜索

Hongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 本文提出 glanco-or-gaze 框架,通过强化学习使大 multimodal 模型主动规划视觉搜索,通过选择性注视和复杂度自适应强化学习提升复杂视觉查询性能。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10935 2025-06-12 cs.CV cs.AI 85%

TSVC:Tripartite Learning with Semantic Variation Consistency for Robust Image-Text Retrieval

Shuai Lyu, Zijing Tian, Zhonghong Ou, Yifan Zhu, Xiao Zhang, Qiankun Ha, Haoran Luo, Meina Song

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract,comments);分类 cs.CV、cs.AI

Comments This paper has been accepted to the Main Track of AAAI 2025. It contains 9 pages, 7 figures, and is relevant to the areas of cross-modal retrieval and machine learning. The work presents a novel approach in robust image-text retrieval using a tripartite learning framework

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 39, No. 18, pp. 19269-19277, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.00726 2020-09-29 cs.CV cs.MM 85%

Unsupervised Multi-modal Hashing for Cross-modal retrieval

Jun Yu, Xiao-Jun Wu

专题命中 跨模态检索 :multi-modal(title);cross-modal(title);分类 cs.CV、cs.MM

Comments 4 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09928 2026-08-11 cs.CV cs.AI cs.CL cs.LG 新提交 85%

Multimodal Model Diffing for Feature Discovery and Control

用于特征发现与控制的多模态模型差异分析

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

机构 * University of Oxford(牛津大学) Microsoft(微软公司)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出MMDiff多模态模型差异分析框架,训练多模态SAEs以识别多模态训练改变的特征,实现特征隔离、检测与控制,在空间、OCR任务及多模态安全攻击评估中展现出良好效果。

Comments Preprint. Accepted at ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交 85%

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19960 2026-06-19 cs.IR 新提交 85%

Stellar: Scalable Multimodal Document Retrieval for Natural Language Queries

Stellar:面向自然语言查询的可扩展多模态文档检索

Yuxiang Guo, Zhonghao Hu, Yuren Mao, Yuhang Liu, Congcong Ge, Xiaolu Zhang, Jun Zhou, Yunjun Gao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 提出Stellar框架,通过磁盘存储令牌级文档嵌入并动态加载候选嵌入,结合词汇表示过滤和高效磁盘支持的后交互,在保持检索效果的同时将内存开销和查询延迟降低1-2个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11572 2026-05-26 cs.CV cs.AI cs.IR cs.MM 85%

Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval

多模态跨域对齐网络用于视频时刻检索

Xiang Fang, Daizong Liu, Pan Zhou, Yuchong Hu

机构 * Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室) Hubei Engineering Research Center on Big Data Security(湖北大数据安全工程研究中心) School of Cyber Science and Engineering(网络安全学院) Huazhong University of Science and Technology(华中科技大学) Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学) School of Computer Science and Technology(计算机科学与技术学院) Key Laboratory of Information Storage System Ministry of Education of China(信息存储系统教育部重点实验室)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出多模态跨域对齐网络,通过域对齐、跨模态对齐和特定对齐三个模块,解决跨域视频时刻检索中域差异和语义鸿沟问题。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05834 2026-05-08 cs.LG 85%

Hidden in the Multiplicative Interaction: Uncovering Fragility in Multimodal Contrastive Learning

乘积交互中的隐藏问题:揭示多模态对比学习中的脆弱性

Tillmann Rheude, Stefan Hegselmann, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究所,柏林查理医院) Intelligent Medicine Institute, Fudan University(智能医学研究院,复旦大学) Department of Mathematics and Computer Science, Freie Universität Berlin(数学与计算机科学系,柏林自由大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出Gated Symile,通过引入对比门机制,解决多模态对比学习中因单个模态信息不足、错位或缺失导致的脆弱性问题,提升检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27600 2026-05-01 cs.IR 85%

Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG

净化多模态检索:用于RAG的片段级证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20626 2026-04-21 cs.AI cs.CL cs.CV cs.IR 85%

MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation

MegaRAG:基于多模态知识图谱的检索增强生成

Chi-Hsiang Hsiao, Yi-Cheng Wang, Tzung-Sheng Lin, Yi-Ren Yeh, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程系) Department of Mathematics, National Kaohsiung Normal University(高雄师范大学数学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心) E.SUN Financial Holding Co., Ltd.(E.SUN财务公司)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MegaRAG通过引入多模态知识图谱,提升大语言模型在跨模态推理中的内容理解能力,在文本和多模态语料中均优于现有RAG方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18010 2026-02-23 cs.SD 85%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19980 2025-12-12 cs.LG 85%

RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis

RAD:迈向可信的检索增强多模态临床诊断

Haolin Li, Tianjie Dai, Zhe Chen, Siyuan Du, Jiangchao Yao, Ya Zhang, Yanfeng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University(上海交通大学医学人工智能研究所)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 RAD通过检索增强多模态模型,提升临床诊断的可信度与准确性,实现任务特定知识的显式注入。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03514 2025-12-04 cs.IR cs.AI cs.CL cs.CV 85%

M3DR: Towards Universal Multilingual Multimodal Document Retrieval

M3DR:迈向通用多语言多模态文档检索

Adithya S Kolavi, Vyoman Jain

机构 * CognitiveLab(认知实验室)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 M3DR提出了一种通用多语言多模态文档检索框架,通过对比训练实现跨语言和跨模态对齐,显著提升了多语言场景下的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02358 2025-11-05 cs.CL cs.AI cs.IR cs.LG cs.MM 85%

Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation

Wongyu Kim, Hochang Lee, Sanghak Lee, Yoonsung Kim, Jaehyun Park

机构 * NC AI(NC人工智能)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted to MMGenSR Workshop (CIKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19312 2025-10-20 cs.IR 85%

DocMMIR: A Framework for Document Multi-modal Information Retrieval

Zirui Li, Siwei Wu, Yizhi Li, Xingyu Wang, Yi Zhou, Chenghua Lin

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

Comments Accepted for publication at EMNLP 2025 Findings. Code and data publicly available at https://github.com/J1mL1/DocMMIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21956 2025-09-30 cs.CV cs.AI cs.CL cs.LG 85%

Cross-modal RAG: Sub-dimensional Text-to-Image Retrieval-Augmented Generation

Mengdan Zhu, Senhao Cheng, Guangji Bai, Yifei Zhang, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14904 2025-08-12 eess.IV cs.AI cs.CL cs.CV 85%

Large-vocabulary forensic pathological analyses via prototypical cross-modal contrastive learning

Chen Shen, Chunfeng Lian, Wanqing Zhang, Fan Wang, Jianhua Zhang, Shuanliang Fan, Xin Wei, Gongji Wang, Kehan Li, Hongshu Mu, Hao Wu, Xinggong Liang, Jianhua Ma, Zhenyuan Wang

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 28 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22864 2025-07-01 cs.CV cs.AI cs.CL 85%

Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval

Li-Cheng Shen, Jih-Kang Hsieh, Wei-Hua Li, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 跨模态检索 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICMR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05794 2025-05-01 cs.AI cs.CL cs.MM cs.SI 85%

HateSieve: A Contrastive Learning Framework for Detecting and Segmenting Hateful Content in Multimodal Memes

Xuanyu Su, Yansong Li, Diana Inkpen, Nathalie Japkowicz

机构 * University of Ottawa(渥太华大学) American University(美国美国大学)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted at NAACL 2025 Findings; camera-ready version

Journal ref Findings Assoc. Comput. Linguistics: NAACL 2025, 5201-5215 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14788 2025-04-22 cs.IR 85%

The 1st EReL@MIR Workshop on Efficient Representation Learning for Multimodal Information Retrieval

Junchen Fu, Xuri Ge, Xin Xin, Haitao Yu, Yue Feng, Alexandros Karatzoglou, Ioannis Arapakis, Joemon M. Jose

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract)

Comments WWW2025 Workshop Summary

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15140 2025-04-01 cs.CV cs.AI cs.CL cs.LG 85%

Analyzing and Boosting the Power of Fine-Grained Visual Recognition for Multi-modal Large Language Models

Hulingxiao He, Geng Li, Zijun Geng, Jinglin Xu, Yuxin Peng

专题命中 跨模态检索 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Published as a conference paper at ICLR 2025. The model is available at https://huggingface.co/StevenHH2000/Finedefics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06254 2025-03-17 cs.CR cs.LG 85%

Poisoned-MRAG: Knowledge Poisoning Attacks to Multimodal Retrieval Augmented Generation

Yinuo Liu, Zenghui Yuan, Guiyao Tie, Jiawen Shi, Pan Zhou, Lichao Sun, Neil Zhenqiang Gong

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09428 2024-12-13 cs.CV cs.MM cs.SD eess.AS 85%

Multimodal Music Generation with Explicit Bridges and Retrieval Augmentation

Baisen Wang, Le Zhuo, Zhaokai Wang, Chenxi Bao, Wu Chengjing, Xuecheng Nie, Jiao Dai, Jizhong Han, Yue Liao, Si Liu

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14476 2024-11-25 cs.CL cs.AI cs.CV 85%

StreetviewLLM: Extracting Geographic Information Using a Chain-of-Thought Multimodal Large Language Model

Zongrong Li, Junhao Xu, Siqin Wang, Yifan Wu, Haiyang Li

专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12866 2024-11-13 cs.CL cs.AI cs.CV 85%

How Does the Textual Information Affect the Retrieval of Multimodal In-Context Learning?

Yang Luo, Zangwei Zheng, Zirui Zhu, Yang You

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12508 2024-10-17 cs.CL cs.AI cs.CV 85%

MERLIN: Multimodal Embedding Refinement via LLM-based Iterative Navigation for Text-Video Retrieval-Rerank Pipeline

Donghoon Han, Eunhwan Park, Gisang Lee, Adam Lee, Nojun Kwak

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments EMNLP 2024 Industry Track Accepted (Camera-Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05405 2024-09-12 cs.CV cs.AI cs.IR cs.MM 85%

A Survey of Multimodal Composite Editing and Retrieval

Suyan Li, Fuxiang Huang, Lei Zhang

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 20 pages, 3 figures, and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01349 2024-08-05 cs.MM cs.AI cs.CV cs.IR cs.LG 85%

PC$^2$: Pseudo-Classification Based Pseudo-Captioning for Noisy Correspondence Learning in Cross-Modal Retrieval

Yue Duan, Zhangxuan Gu, Zhenzhe Ying, Lei Qi, Changhua Meng, Yinghuan Shi

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13478 2024-06-12 cs.IR cs.CL cs.CV cs.MM 85%

SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval

Siwei Wu, Yizhi Li, Kang Zhu, Ge Zhang, Yiming Liang, Kaijing Ma, Chenghao Xiao, Haoran Zhang, Bohao Yang, Wenhu Chen, Wenhao Huang, Noura Al Moubayed, Jie Fu, Chenghua Lin

专题命中 跨模态检索 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments camera-ready version for ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏