Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
看到并不等于相信:揭示评估者视觉-语言模型的盲区
机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) ; Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; BITS Pilani, Hyderabad(海得拉巴 BITS学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)
AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。