See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
看见、听见与理解:多模态大语言模型中人类语音理解基准测试
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Kookmin University(国民大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。
Comments Findings of CVPR 2026