SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes
SpatialAct:探测VLM智能体在3D场景中的空间推理到行动能力
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学) ; Helsinki University(赫尔辛基大学)
专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV
AI总结 本文提出SpatialAct基准,通过多轮交互细化、单步错误检测与修复等任务,揭示当前视觉语言模型在3D场景中从空间推理到行动存在显著差距。