Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions
通过多样声学条件下的语音查询评估音频-视觉多模态大语言模型的幻觉
机构 * Department of Intelligent Software, Sungkyunkwan University(智能软件系,成均馆大学) ; Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,成均馆大学)
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);image-text(abstract);分类 cs.AI、eess.AS
AI总结 研究探讨语音查询对多模态幻觉的影响,通过RePOPE-Spk基准测试发现语音查询导致错误率显著增加,提出改进方法以提升语音界面可靠性。
Comments Submitted to Interspeech2026