arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 9 篇

2606.04240 2026-06-04 cs.CV cs.AI cs.CL 82%

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

EReL@MIR 2025 多模态文档检索挑战赛(赛道1)概述

Jingbiao Mei

机构 * University of Cambridge(剑桥大学) Cambridge United Kingdom(剑桥英国)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文介绍了EReL@MIR 2025多模态文档检索挑战赛(赛道1)的设计、数据集、评估协议、最终排名及前三名获胜系统的分析,所有系统均基于Qwen2-VL系列解码器多模态大语言模型嵌入器。

Comments MDR Challenge Report at WWW2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04591 2026-06-04 cs.CL cs.CV 81%

Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues

多模态长对话中的细粒度片段检索

Hanbo Bi, Zhiqiang Yuan, Chongyang Li, Qiwei Yan, Zexi Jia, Jiapei Zhang, Xiaoyue Duan, Yingchao Feng, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(模式识别中心、微信AI、腾讯公司) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所、中国科学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出细粒度片段检索任务,通过强化学习训练的生成式检索模型F2RVLM和两阶段系统FFRS,实现多模态长对话中多语句、多图像片段的精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04231 2026-06-04 cs.CL cs.AI 81%

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG:面向通用企业问答的多模态检索增强生成再思考

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

机构 * JPMorgan Chase & Co.(摩根大通公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MM-BizRAG框架,通过文档结构感知分割和布局感知解析,结合统一LLM驱动的工件转换与推理时多模态组装,无需微调即可提升企业文档问答性能,在异构企业数据集和两个公开基准上超越基线最多32个百分点。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04604 2026-06-04 cs.CV 70%

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations

COMBINER: 基于属性邻居关系的组合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Haokun Wen, Xuemeng Song, Liqiang Nie

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对组合图像检索中视觉相似但属性不同的样本问题,提出基于属性原型的跨模态统一表示方法COMBINER,通过自适应语义解耦、统一原型组合和双重关系建模提升检索准确性。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00104 2026-06-04 cs.CV cs.AI 62%

R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation

R3G: 一种面向以视觉为中心的答案生成的推理-检索-重排序框架

Zhuohong Chen, Zhengxian Wu, Zirui Liao, Shenao Jiang, Hangrui Xu, Yang Chen, Chaokui Su, Xiaoyu Liu, Haoqian Wang

机构 * The Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) State Key Laboratory of Nuclear Power Safety Technology and Equipment, China(核能安全技术与装备国家重点实验室) School of Computer Science and Information Engineering, Hefei University of Technology, China(合肥工业大学计算机科学与信息工程学院)

专题命中 跨模态检索 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出R3G框架,通过先制定推理计划指定所需视觉线索,再采用粗检索加细粒度重排序的两阶段策略选择证据图像,在MRAG-Bench上提升六种多模态大语言模型在九个子场景中的准确率,实现整体最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01537 2026-06-04 cs.CV cs.LG 61%

PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder

PaCX-MAE: 生理增强的胸部X光掩码自编码器

Yancheng Liu, Kenichi Maeda, Manan Pancholy

机构 * University of California, Berkeley(加州大学伯克利分校) University of Tokyo(东京大学) University of Michigan(密歇根大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV;multi-modal(comments)

AI总结 提出PaCX-MAE跨模态蒸馏框架,通过双对比预测目标将生理先验注入胸部X光编码器,在保持单模态推理的同时提升生理相关任务性能。

Comments Accepted at the ICML 2026 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04133 2026-06-04 cs.CV 57%

Pinpoint: Grounded Worldwide Image Geolocation via Cross-Source Retrieval and Reranking

Pinpoint: 基于跨源检索与重排序的全球图像地理定位

Nika Chuzhoy, Brian Hu, Amit A. Arora, Jae Ro, Sarthak S. Sahu

机构 * Virtualitics

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种检索-重排序架构Pinpoint,通过对比学习融合Flickr照片和街景图像,结合注意力重排序器利用跨源证据实现全球图像地理定位,在多个基准上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04061 2026-06-04 cs.CV 57%

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

模态内邻居从不说谎:基于图模态内推理纠正模态间噪声对应

Yang Liu, Wentao Feng, Shu-Dong Huang, Yalan Ye, Jiancheng Lv

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出IN2R框架,利用模态内数据的几何稳定性,通过图精炼器对动态跨模态记忆中的邻居进行关系推理,合成连续软原型以纠正模态间噪声对应,显著提升跨模态检索性能。

Journal ref International Conference of Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04477 2026-06-04 cs.RO 50%

TransTac: Visuo-Tactile Modality Transition via Ultraviolet-Encoded Transparent Elastomers

TransTac: 通过紫外编码透明弹性体实现视觉-触觉模态转换

Lingyue Yang, Bin Fang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 提出一种透明紫外编码双目视觉触觉传感器TransTac,结合视觉观察与标记触觉重建,通过先验引导的Delaunay立体匹配算法实现鲁棒稀疏三角化,在零样本触觉图像识别上达到83.3%准确率,并显著增强跨模态对齐。

Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA) 2026. 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏