Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) ; Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) ; Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV
AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。