arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 23 篇

2604.17054 2026-04-21 cs.CV cs.AI 86%

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR 85%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20626 2026-04-21 cs.AI cs.CL cs.CV cs.IR 85%

MegaRAG: Multimodal Knowledge Graph-Based Retrieval Augmented Generation

MegaRAG:基于多模态知识图谱的检索增强生成

Chi-Hsiang Hsiao, Yi-Cheng Wang, Tzung-Sheng Lin, Yi-Ren Yeh, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与信息工程系) Department of Mathematics, National Kaohsiung Normal University(高雄师范大学数学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心) E.SUN Financial Holding Co., Ltd.(E.SUN财务公司)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MegaRAG通过引入多模态知识图谱,提升大语言模型在跨模态推理中的内容理解能力,在文本和多模态语料中均优于现有RAG方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV 82%

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16313 2026-04-21 cs.IR cs.AI cs.CL 81%

MARA: A Multimodal Adaptive Retrieval-Augmented Framework for Document Question Answering

MARA:一种多模态自适应检索增强框架用于文档问答

Hui Wu, Haoquan Zhai, Yuchen Li, Hengyi Cai, Peirong Zhang, Yidan Zhang, Lei Wang, Chunle Wang, Yingyan Hou, Shuaiqiang Wang, Dawei Yin

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), AIRI, CAS(目标认知与应用技术重点实验室(TCAT),空气动力研究所,中国科学院) School of Electronic, Electrical and Communication Engineering, UCAS(电子、电气与通信工程学院,中国科学院大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) Baidu Inc.(百度公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MARA框架通过引入查询自适应机制提升多模态文档检索与生成的精度和质量,实验表明其在多模态问答基准上优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 81%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02073 2026-04-21 cs.CV 79%

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME:基于潜在推理的通用多模态嵌入

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

机构 * Southeast University(东南大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 PLUME通过引入潜在推理框架改进通用多模态嵌入,用连续潜在状态的自回归滚动替代显式推理链,减少推理开销并提升效率,优于传统显式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17394 2026-04-21 cs.CV 79%

LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models

面向RAG的医疗诊断的LVLM感知多模态检索

Nir Mazor, Tom Hope

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校计算机科学与工程学院) The Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轻量级机制提升检索增强LVLM的诊断性能,通过轻量微调和通用模型实现临床分类和VQA任务的竞争力结果,并分析不一致检索预测问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI 79%

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 70%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18051 2026-04-21 cs.CV 70%

INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval

INTENT: 为鲁棒的复合图像检索的不变性与判别意识噪声缓解

Zhiwei Chen, Yupeng Hu, Zhiheng Fu, Zixu Li, Jiale Huang, Qinlei Huang, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出INTENT网络,通过视觉不变组成和双目标判别学习处理复合图像检索中的两种噪声类型,提升检索鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17581 2026-04-21 cs.LG cs.AI q-bio.NC 70%

How Much Data is Enough? The Zeta Law of Discoverability in Biomedical Data, featuring the enigmatic Riemann zeta function

需要多少数据?生物医学数据的发现率ζ定律,涉及神秘的黎曼ζ函数

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging & Informatics(神经影像与信息学史蒂文斯研究所) University of Southern California(南加州大学) Los Angeles, CA, USA(洛杉矶,加利福尼亚州,美国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于数据协方差算子谱结构的跨模态发现率定律框架,揭示性能指标与ζ函数的关系,为数据规模、表示学习和多模态扩展提供理论指导。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18508 2026-04-21 cs.IR cs.AI cs.CL 62%

Document-as-Image Representations Fall Short for Scientific Retrieval

基于文档的图像表示在科学检索中表现不佳

Ghazal Khalighinejad, Raghuveer Thirukovalluru, Alexander H. Oh, Bhuwan Dhingra

机构 * Department of Computer Science(计算机科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArXivDoc新基准,通过LaTeX源代码构建,对比文本、图像和多模态检索方法,发现基于图像的文档表示效果差,文本表示更有效,多模态方法表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 62%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19549 2026-04-21 cs.CL cs.CV cs.IR 62%

Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework

塑造向量空间:通过剪枝-然后-融合框架实现高效的多向量视觉文档检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Jiahao Huo, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出剪枝-然后-融合框架,通过两阶段方法提升多向量视觉文档检索效率,实验表明其在压缩率与特征保真度间取得平衡,显著扩展近无损压缩范围。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13707 2026-04-21 cs.CV cs.AI cs.LG 62%

Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs

注意力空间对比引导用于高效缓解大视觉-语言模型中的幻觉

Yujin Jo, Sangyoon Bae, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Attention-space Contrastive Guidance方法,通过对比引导生成更视觉一致且语义忠实的文本,实验表明在CHAIR和POPE数据集上提升了忠实度并降低了延迟。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18037 2026-04-21 cs.CV 57%

HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval

HABIT: 时序协同鲁棒渐进学习框架用于复合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Shiqi Zhang, Qinlei Huang, Zhiheng Fu, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 HABIT框架通过互知识估计模块和双一致性渐进学习模块,解决复合图像检索中的噪声三元组对应问题,提升鲁棒性和检索性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17898 2026-04-21 cs.CV 57%

ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

ReTrack:基于证据的双流方向锚校准网络用于复合视频检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Qinlei Huang, Guozhi Qiu, Zhiheng Fu, Meng Liu

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 ReTrack通过校准复合特征的方向偏差,解决复合视频检索中模态贡献纠缠、特征优化和检索不确定性问题,实现多模态查询理解的提升,并在复合图像检索任务中取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15951 2026-04-21 cs.AI 57%

Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval

图、大语言模型与代理的整合:推理与检索

Hamed Jelodar, Samita Bai, Mohammad Meymani, Parisa Hamedi, Roozbeh Razavi-Far, Ali Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,计算机科学学院,新不伦瑞克大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了图与大语言模型整合的设计选择,分类了基于用途、图模态和整合策略的方法,探讨了不同领域中的适用场景和优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 57%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16678 2026-04-21 cs.LG 50%

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels

UniCon:通过核方法实现高效的对比对齐统一框架

Hangke Sui, Yuqing Wang, Minh N Do

机构 * Department of Electrical & Computer Engineering, The Grainger College of Engineering, UIUC(电气与计算机工程系,格拉inger工程学院,伊利诺伊大学香槟分校) Siebel School of Computing and Data Science, The Grainger College of Engineering, UIUC(计算与数据科学学院,格拉inger工程学院,伊利诺伊大学香槟分校) Coordinated Science Laboratory, University of Illinois Urbana-Champaign (UIUC)(协调科学实验室,伊利诺伊大学香槟分校) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 UniCon通过引入对比相似度权重矩阵S(γ),提供了一种统一的对比对齐框架,实现了闭式全局解,替代了 minibatch反向传播,提升了效率并保持了通用性和性能。

Comments 33 pages, 8 figures, 8 tables. Accepted by The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08411 2026-04-21 cs.IR 50%

A Sketch+Text Composed Image Retrieval Dataset for Thangka

用于唐卡的草图+文本组合图像检索数据集

Jinyu Xu, Yi Sun, Jiangling Zhang, Qing Xie, Daomin Ji, Zhifeng Bao, Jiachen Li, Yanchun Ma, Yongjian Liu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出CIRThan数据集,包含2287张高质量唐卡图像,每张图像配有人工绘制的草图和三级语义描述,支持联合表达结构意图和多级语义的组合查询,用于推动文化遗址和知识特定视觉领域的草图+文本组合图像检索研究。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏