Guide, Think, Act: Interactive Embodied Reasoning in Vision-Language-Action Models
引导、思考、行动:面向视觉-语言-动作模型的交互式具身推理
Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang, Xiaoke Jiang, Chuanxiu Liu, Jie Liu, Lei Zhang
机构
*
Futian Laboratory(福田实验室)
;
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))
;
School of Robotics, Hunan University(湖南大学机器人学院)
;
South China University of Technology(华南理工大学)
;
Visincept(Visincept公司)
;
National Key Laboratory of Smart Farm Technologies and Systems(智能农业技术与系统国家重点实验室)