RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation
RARM:基于置信度门控的进展奖励建模用于操作中的强化学习
机构 * NUS Human-Centered Robotic Lab(新加坡国立大学人机共融机器人实验室) ; University of Cambridge(剑桥大学) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 提出参考锚定奖励模型(RARM),通过对比时间目标从通用视频中学习,将单个成功演示转化为密集进展奖励,并在部署时通过置信度门控抑制虚假正奖励,在长时域操作任务中显著提升强化学习成功率。