SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation
SARM:面向长时间 horizon 的机器人操控阶段感知奖励建模
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robot learning(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出一种基于视频的阶段感知奖励建模框架,通过自然语言子任务标注实现一致标签,提升长horizon任务的鲁棒性和泛化能力,实验表明其在真实世界和人类验证中表现优异。