Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation
Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) ; Yuanpei College, Peking University(北京大学元培学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。