From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs
从感知到决策:多模态大语言模型中听觉与视觉感知的信息流
机构 * Surrey Institute for People-Centred AI (PAI)(萨里人本人工智能研究所) ; University of Surrey(萨里大学) ; Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究多模态大语言模型(AVLLMs)中音频和视觉信息流的路径与整合机制,发现顺序流与并行流两种路由模式,并证明信息传递后可丢弃无关token以提升效率。
Comments 40 pages, 29 figures