Probing Cross-modal Information Hubs in Audio-Visual LLMs
探测音频-视觉大语言模型中的跨模态信息枢纽
机构 * Department of Electrical Engineering, Korea Advanced Institute of Science ; The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI、eess.AS
AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。
Comments Accepted by ICML 2026