Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy
现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施
机构 * NAVER Cloud AI(NAVER云AI) ; KAIST AI(韩国国立庆北大学AI)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM
AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。
Comments Accepted to Interspeech 2026