Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差
机构 * York University(约克大学) ; University of Guelph(圭尔夫大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。
Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)