EATR-Stereo: Embodiment-Aware Token Routing of Paired Stereo Evidence for Humanoid Vision-Language-Action Control
EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由
机构 * Harbin Institute of Technology(哈尔滨工业大学)
AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。
Comments 8 pages, 5 figures