arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-01 至 2026-06-01 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 8 篇

2605.30818 2026-06-01 cs.ET cs.AI cs.SD 83%

GaMi: Geometry-Agnostic Material Identification via Cross-Modal Subtractive Disentanglement

GaMi: 通过跨模态减法解缠实现几何无关的材料识别

Zhiwei Chen, Yijie Li, Yimo Zhang, Shiyun Shao, Yichao Chen, Dian Ding, Liang Wang, Haiwei Wu, Liwei Guo, Jie Yang, Xiaosong Zhang, Yongzhao Zhang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出GaMi系统,利用毫米波和声学传感的跨模态减法解缠框架,在不受约束的几何条件下实现高精度材料识别。

Comments 17 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31312 2026-06-01 cs.CV cs.CL 81%

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

从细粒度视觉差异中学习:通过上下文视觉对比优化缓解多模态幻觉

Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * The Hong Kong University of Science(香港科学与技术大学) OPPO AI Center(OPPO AI中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出上下文视觉对比优化(IC-VCO)方法,通过共享多图像上下文中的对比图像确保数学严谨的目标,并引入视觉对比蒸馏(VCDist)和对比样本编辑策略,有效缓解多模态幻觉。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31229 2026-06-01 cs.CV cs.AI 81%

Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval

超越分类:面向持续多模态检索的动态适配器路由

Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert, Szymon Lukasik, Bartlomiej Twardowski

机构 * NASK National Research Institute(NASK国家研究院) IDEAS Research Institute(IDEAS研究所) Warsaw University of Technology(华沙技术大学) Universitat Autonoma de Barcelona(巴塞罗那自治大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对持续多模态检索(CMR)任务,提出基于原型路由和模型合并的动态适配器路由(DAR)方法,在跨域评估中取得优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30917 2026-06-01 cs.IR cs.CV 79%

Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

无推理多模态学习稀疏检索用于生产级视觉文档搜索

Gyu-Hwung Cho, Youngjune Lee, Kiyoon Jeong, Siyoung Lee, Sanggyu Han, Hervé Dejean, Stéphane Clinchant, Seung-won Hwang

机构 * NAVER Corp.(NAVER公司) Seoul National University(首尔国立大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出V-SPLADE,一种无需推理的稀疏检索器,通过标题门控令牌监督解决视觉稀疏表示中的词汇基础问题,在视觉文档检索中达到稠密级效果。

Comments 12 pages, 5 figures, 12 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10809 2026-06-01 cs.CV cs.IR 79%

DeepImageSearch: Benchmarking Multimodal Agents for Context-Aware Image Retrieval in Visual Histories

DeepImageSearch: 多模态智能体在视觉历史中上下文感知图像检索的基准测试

Chenlong Deng, Mengjie Deng, Junjie Wu, Dun Zeng, Teng Wang, Qingsong Xie, Jiadeng Huang, Shengjie Ma, Changwang Zhang, Zhaoxiang Wang, Jun Wang, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) OPPO Research Institute(OPPO研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出DeepImageSearch范式,将图像检索重构为自主探索任务,通过构建DISBench基准和模块化智能体框架,验证了在视觉历史中基于隐式上下文线索进行多步推理的必要性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06484 2026-06-01 cs.CL 77%

ValueGround: Evaluating Culture-Conditioned Visual Value Grounding in MLLMs

ValueGround: 评估多模态大语言模型中文化条件化的视觉价值基础

Zhipin Wang, Christoph Leiter, Christian Frey, Mohamed Hesham Ibrahim Abdalla, Josif Grabocka, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CL

AI总结 提出ValueGround基准,通过最小对比图像对评估多模态大语言模型在文化条件化视觉价值判断中的表现,发现模型在可视化选项下准确率显著低于文本选项。

Comments Updated preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31503 2026-06-01 cs.CV cs.LG 57%

How can embedding models bind concepts?

嵌入模型如何绑定概念?

Arnas Uselis, Darina Koishigarina, Seong Joon Oh

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言嵌入模型(如CLIP)在概念绑定上的局限性,发现场景嵌入可加性分解为对象表示,但CLIP的高复杂度绑定函数阻碍了泛化,而通过充分数据训练的Transformer模型能学习低复杂度乘法交互绑定函数实现系统泛化。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00265 2026-06-01 cs.LG 50%

Polaris: Coupled Orbital Polar Embeddings for Hierarchical Concept Learning

Polaris: 用于层次概念学习的耦合轨道极坐标嵌入

Sahil Mishra, Srinitish Srinivasan, Sourish Dasgupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校,新德里,印度) Indian Institute of Technology Delhi, Abu Dhabi, UAE(印度理工学院德里分校,阿布扎比,阿联酋) KDM Lab, Dhirubhai Ambani University Gandhinagar, Gujarat, India(KDM实验室,迪鲁布希阿姆巴尼大学冈丁加尔,古吉拉特邦,印度)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 提出Polaris极坐标超球面嵌入框架,通过角度和半径分离语义与层次,结合局部约束、全局正则化和不确定性感知非对称目标,在多种层次结构扩展任务中显著提升检索性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏