Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理
机构 * Futian Laboratory(福田实验室) ; Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) ; School of Robotics, Hunan University(湖南大学机器人学院) ; South China University of Technology(华南理工大学) ; Visincept(Visincept公司) ; National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV
AI总结 本文提出GTA-VLA框架,通过允许用户用显式视觉提示引导机器人策略,实现空间可调节的具身推理。该框架整合了外部指导与内部任务规划,提升了在视觉歧义和错误恢复中的表现。