JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力
机构 * University of Southern California(南加州大学) ; National University of Singapore(新加坡国立大学) ; Adobe Research(奥多比研究院) ; Texas A&M University(德克萨斯农工大学) ; Rice University(莱斯大学) ; The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 本研究提出JigShape拼图基准,发现零样本VLM大多缺乏几何推理能力,所有模型在大尺寸拼图上均出现性能崩塌,将可扩展几何推理确立为VLM的开放性挑战。