arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-07 至 2026-07-07 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 12 篇

2606.16494 2026-07-07 cs.CL cs.AI cs.CV 新提交 82%

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

迷失在末尾:多模态检索增强问答中的首因偏差

Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The Ohio State University(俄亥俄州立大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态知识型视觉问答中检索上下文的位置依赖,发现不同于纯文本的U形效应,出现首因偏差(开头优于末尾),并通过消融实验定位原因为指令调优阅读器的提示槽0。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04836 2026-07-07 cs.IR 版本更新 82%

Beyond Text: Aligning Vision and Language for Multimodal E-Commerce Retrieval

超越文本:为多模态电子商务检索对齐视觉与语言

Qujiaheng Zhang, Guangyue Xu, Fengjie Li

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 研究电子商务领域双塔检索模型的统一文本-图像融合,指出特定领域微调及查询与产品文本和图像模态的两阶段对齐很关键,提出新型模态融合网络并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04410 2026-07-07 cs.CL 新提交 79%

AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes

2026年EXIST竞赛中的AI奇才:用于表情包中多模态性别歧视识别的分层软标签学习

Matteo Fasulo, Antonio Gravina, Luca Tedeschini, Luca Babboni

机构 * EXIST Lab(EXIST实验室) CLEF(信息检索评价论坛) Swiss Data Science Center, ETH Zürich(瑞士苏黎世联邦理工学院瑞士数据科学中心) Everest Systems GmbH(珠穆朗玛峰系统有限公司) Villanova.ai S.P.A(维拉诺瓦人工智能股份公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 针对表情包多模态性别歧视识别,将任务分层建模为基于经验注释者分布的条件软标签预测,用轻量级门控MLP映射视觉语言表征,在竞赛中取得好成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20280 2026-07-07 cs.IR cs.AI 新提交 79%

ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA:探索排序驱动的通用多模态检索

Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) MiLM Plus Xiaomi Inc(小米公司) Zhongguancun Academy(中关村学院) Beijing, China(北京市)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ELVA框架,通过基于规则的强化学习缓解对比学习中的粒度盲视问题,在通用多模态检索中实现排序优化,并在新基准MRBench上提升13.1%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-07-07 cs.CV 版本更新 79%

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04820 2026-07-07 cs.LG 新提交 78%

KinEMbed: Decoding Kinematics from Electromyography via Cross-Modal Contrastive Learning

KinEMbed:通过跨模态对比学习从肌电图中解码运动学

Sofia Gilardini, Chenfei Ma, Kianoush Nazarpour

机构 * Department of Statistics, University of Oxford(牛津大学统计学系) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究从表面肌电图解码手部运动学这一挑战,提出跨模态对比学习框架KinEMbed训练双编码器,用于手部运动学回归,在NinaPro DB8数据集上优于基线方法。

Comments ICML 2026 Workshop on Structured Data for Health, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04339 2026-07-07 cs.LG cs.AI cs.CR 新提交 74%

One Framework for All: Cross-Modal Membership Inference for Generative Models

一框架适用于所有:生成模型的跨模态成员推理

Dayong Ye, Tainqing Zhu, Kun Gao, Junhao Liu, Yichuan Chen, Shuai Zhou, Hengzhu Liu, Bo Liu, Wanlei Zhou

专题命中 跨模态检索 :cross-modal(title);分类 cs.AI

AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04625 2026-07-07 cs.CV cs.AI 新提交 62%

Hierarchical Evidence-Driven Reasoning for Long Document Understanding

用于长文档理解的分层证据驱动推理

Junyu Xiong, Yonghui Wang, Rongjian Gu, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有多模态RAG管道面临的问题,提出分层证据驱动的多模态RAG框架HIEVI-RAG,通过四阶段管道,包括分层问题分解、粗视觉页面检索、细粒度页面验证和内存引导迭代生成,提升长文档理解,效果显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03978 2026-07-07 cs.HC cs.AI cs.CV 新提交 62%

Scalable Semantic Steering of Embedding Projections

嵌入投影的可扩展语义引导

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

机构 * Virginia Tech(弗吉尼亚理工学院) Department of Defense(国防部) Tulane University(路易斯安那州立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究高维数据嵌入的低维投影语义结构问题,提出可扩展语义引导方法,将语义计算从单个项目转移到用户定义组,通过单LLM调用为组生成结构化配置文件,减少LLM调用并在多模态嵌入中有效应用。

Comments Accepted as a short paper at IEEE VIS 2026. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04665 2026-07-07 cs.CV 新提交 57%

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval

DiCE-CIR:用于高效零样本合成图像检索的直接合成学习

Gwang-Ho Na, Ho-Joong Kim, Seong-Whan Lee

机构 * Institute of Information & Communications Technology Planning & Evaluation (IITP)(信息通信技术规划与评估研究所(IITP)) Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究零样本合成图像检索问题,提出直接合成学习方法DiCE-CIR,直接组合参考图像和编辑文本预测合成查询表示,用大语言模型自动构建训练样本,训练轻量级模块,实验表明其性能优且效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03865 2026-07-07 cs.RO cs.AI 新提交 57%

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching

通过递归校正、频率一致性和对比流匹配实现高保真一步生成视觉运动策略

Yuran Chen, Xinye Cai, Zhonglin Gong, Yang Huang

机构 * School of Safety Science and Engineering, Anhui University of Science and Technology(安徽理工大学安全科学与工程学院) State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学煤矿智能开采技术与装备国家重点实验室) School of Artificial Intelligence, Anhui University of Science and Technology(安徽理工大学人工智能学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究针对生成模型多步采样有延迟、一步加速方法有偏差等问题,提出含递归校正、频率一致性和对比流匹配三机制的框架,解决相关问题,实验显示该方法在低延迟下性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13533 2026-07-07 cs.CV 版本更新 57%

Language-guided Medical Image Segmentation with Target-informed Multi-level Contrastive Alignments

基于目标感知多级对比对齐的语言引导医学图像分割

Mingjian Li, Mingyuan Meng, Shuchang Ye, Mingye Zou, Michael Fulham, Lei Bi, Jinman Kim

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(北京中关村学院及中关村人工智能研究院) Department of Molecular Imaging, Royal Prince Alfred Hospital(皇家珀斯阿尔弗雷德医院分子成像部)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 研究针对医学图像分割,提出目标感知多级对比对齐框架,通过引入目标敏感语义距离模块、多级对比对齐策略和语言引导目标增强模块,弥合图文模态差距,实现细粒度文本引导,实验证明性能优于现有方法。

Comments Published in Expert Systems with Applications (ESWA)

详情

展开后加载摘要…

URL PDF HTML 收藏