Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器
机构 * University of New South Wales(新南威尔士大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。