arXivDaily arXiv每日学术速递 周一至周五更新

作者

Pieter Abbeel

Robotics

2026-06-10 至 2026-06-10 共收录 1
2606.10305 2026-06-10 cs.RO 新提交

SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation

SARM2: 多任务阶段感知奖励建模用于自我改进的机器人操作

Qianzhong Chen, Hau Zheng, Justin Yu, Suning Huang, Jiankai Sun, Ken Goldberg, Chuan Wen, Pieter Abbeel, Yide Shentu, Philipp Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出多任务阶段感知奖励模型RM,结合动作基元阶段估计器和多门控专家混合值头,为机器人操作任务提供密集逐步奖励,并基于RM构建SPIRAL框架,通过廉价自主轨迹改进VLA策略,在10任务基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏