When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Birmingham(伯明翰大学)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。