Look, Zoom, Understand: The Robotic Eyeball for Embodied Perception
看、聚焦、理解:用于具身感知的机器人眼球
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Dalian University of Technology(大连理工大学)
专题命中 模仿学习与强化学习 :robotic(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 本文提出EyeVLA框架,通过整合视觉感知、语言理解和物理摄像头控制,实现语言引导的主动视觉感知。该框架在500个真实样本上训练,使机器人在50种不同场景中完成任务的平均完成率为96%。