SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation
SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。