Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation
Robo-Dopamine 2.0:面向机器人操纵的历史条件感知与分布外感知过程奖励建模
机构 * Peterson Co(彼得森公司)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI
AI总结 本文提出Robo-Dopamine 2.0,一种历史条件与分布外感知的过程奖励模型,结合带符号跳课程训练,提升了机器人操纵的视觉顺序一致性与分布外鲁棒性,在下游强化学习中取得优异的真实世界任务表现。