arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-24 至 2026-06-24 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 2 篇

2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交 85%

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22220 2026-06-24 cs.CV cs.AI cs.LG 新提交 84%

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning

MultiMem: 多模态对比学习中的记忆化测量与缓解

Wenhao Wang, Franziska Boenisch, Michael Backes, Adam Dziedzic

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出首个多模态对比学习记忆化度量MultiMem,发现跨模态语义错位是主要驱动因素,文本模态影响最大,并通过跨模态增强有效降低记忆化并提升性能。

Comments Accepted at The 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏