arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-02 至 2026-06-02 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 13 篇

2603.14405 2026-06-02 cs.LG cs.AI 87%

ES-Merging: Biological MLLM Merging via Embedding Space Signals

ES-Merging: 通过嵌入空间信号进行生物多模态大模型合并

Wonbin Lee, Dongki Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出ES-Merging框架,利用嵌入空间信号估计合并系数,实现生物多模态大模型的高效合并,提升跨模态推理和单模态知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01753 2026-06-02 cs.CV 87%

ObjEmbed: Towards Universal Multimodal Object Embeddings

ObjEmbed:迈向通用多模态对象嵌入

Shenghao Fu, Yukun Su, Fengyun Rao, Jing Lyu, Xiaohua Xie, Wei-Shi Zheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV

AI总结 提出ObjEmbed模型,通过分解图像为多个区域嵌入(每个对应一个对象)并生成语义和IoU两种互补嵌入,实现细粒度视觉-语言对齐,在视觉定位、局部和全局图像检索等任务中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09095 2026-06-02 cs.CL cs.CV 84%

Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMs

阅读,而非思考:理解并弥合多模态大语言模型中文本变为像素时的模态差距

Kaiser Sun, Xiaochuang Yuan, Hongjun Liu, Chen Zhao, Cheng Zhang, Mark Dredze, Fan Bai

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊) New York University(纽约大学) Texas A&M University(德克萨斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 本文系统诊断多模态大语言模型在处理图像文本时的模态差距,发现其源于模型推理意愿不足而非感知失败,并提出一种轻量级自蒸馏方法有效弥合该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24870 2026-06-02 cs.CL cs.CV cs.IR 81%

Seeing Through the MiRAGE: Evaluating Multimodal Retrieval Augmented Generation

看穿MiRAGE:评估多模态检索增强生成

Alexander Martin, William Walden, Reno Kriz, Dengjia Zhang, Kate Sanders, Eugene Yang, Chihsheng Jin, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 提出MiRAGE框架,通过InfoF1和CiteF1指标评估多模态RAG的事实性和引用支持,并验证其与人工判断的一致性。

Comments https://github.com/alexmartin1722/mirage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01737 2026-06-02 cs.AI 79%

TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination

TrafficRAG:用于交通事故责任认定的多模态RAG框架

Xu Li, Zedong Fu, Xinyi Li, Xun Han

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出TrafficRAG框架,通过视觉语言模型生成结构化描述、混合检索获取法规和案例、大语言模型融合多模态证据进行推理,实现自动化交通事故责任分析报告生成。

Comments 12 pages, 3 figures, accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00740 2026-06-02 cs.IR cs.MM 79%

SpikeHash: Learning Binary Codes with Spiking Neural Networks for Cross-Modal Hashing Retrieval

SpikeHash: 使用脉冲神经网络学习二进制码用于跨模态哈希检索

Yukuan Zhang, Jiarui Zhao, Shangqing Nie, Shengsheng Wang

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.MM

AI总结 提出SpikeHash框架,通过脉冲状态演化、方向性脉冲交互和竞争性脉冲读出实现跨模态哈希检索,在三个基准数据集上取得竞争性检索精度并降低参数量和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV 79%

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02242 2026-06-02 cs.CV cs.AI cs.LG 62%

Towards Resolving Optimization Conflicts Between Image- and Text-Based Person Re-Identification

解决基于图像和基于文本的行人重识别之间的优化冲突

Karina Kvanchiani, Timur Mamedov

机构 * Tevian, Russia(俄罗斯Tevian) Lomonosov Moscow State University, Russia(俄罗斯罗蒙诺索夫莫斯科国立大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对图像与文本行人重识别任务因模态差异和目标冲突导致共享表示次优的问题,提出解耦两阶段训练流程,使用单一视觉编码器避免跨任务干扰,实验表明图像预训练和文本监督能提升双任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01223 2026-06-02 cs.CL cs.AI 62%

Connecting the Dots: Benchmarking Reflective Memory in Long-Horizon Dialogue

连接点:长时对话中的反思性记忆基准测试

Jingjie Lin, Bingbing Wang, Zihan Wang, Zhengda Jin, Weiming Qiao, Jing Li, Ruifeng Xu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法衡量从碎片化多模态线索合成高层解释的反思性记忆问题,提出RefMem-Bench基准和REMIND层次框架,通过渐进式证据感知、定位和抽象提升模型反思性记忆能力。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00910 2026-06-02 cs.CV cs.LG 57%

Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval

推理、检索、重排序:一种用于组合视频检索的零样本推理感知框架

Ali Alavi

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出R3-CoVR零样本管道,通过多模态大模型推理编辑后状态、对比编码检索和约束感知重排序,在CVPR 2026 VidLLMs挑战赛上达到91.9% R@1和98.2% R@10。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21511 2026-06-02 cs.IR cs.CL 57%

From Tokens to Concepts: Leveraging SAE for SPLADE

从词元到概念:利用稀疏自编码器增强SPLADE

Yuxuan Zong, Mathias Vast, Basile Van Cooten, Laure Soulier, Benjamin Piwowarski

机构 * Sorbonne Université, CNRS, ISIR Paris France(索邦大学、国家科学研究中心、巴黎信息科学研究所法国)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL

AI总结 针对SPLADE依赖骨干词汇表导致多义性和同义性等问题,提出用稀疏自编码器学习的语义概念空间替换词汇表,实现性能相当且效率提升。

Comments 11 pages, 3 figures, 9 tables. To appear at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03384 2026-06-02 cs.CR cs.SD 50%

DECKER: Domain-invariant Embedding for Cross-Keyboard Extraction and Recognition

DECKER: 跨键盘提取与识别的域不变嵌入

Bikrant Bikram Pratap Maurya, Nitin Choudhury, Daksh Agarwal, Arun Balaji Buduru

机构 * IIIT-Delhi(印度德里理工学院) Guru Gobind Singh Indraprastha University(戈克辛格印度教大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 针对键盘声学侧信道攻击的跨键盘、跨用户和噪声环境泛化问题,提出包含四阶段域不变击键推理框架DECKER,并构建了多维度数据集HEAR,实验表明该方法在跨键盘和跨用户场景下显著提升击键识别性能。

Comments Accepted to AsiaCCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO 50%

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏