2603.02115
2026-05-15
cs.RO
cs.AI
cs.LG
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
Robometer:通过轨迹比较扩展通用机器人奖励模型
Anthony Liang, Yigit Korkmaz, Jiahui Zhang, Minyoung Hwang, Abrar Anwar, Sidhant Kaushik, Aditya Shah, Alex S. Huang, Luke Zettlemoyer, Dieter Fox, Yu Xiang, Anqi Li, Andreea Bobu, Abhishek Gupta, Stephen Tu, Erdem Biyik, Jesse Zhang
机构
*
Univ. of Southern California(南加州大学)
;
UT Dallas(德克萨斯大学达拉斯分校)
;
MIT(麻省理工学院)
;
Indep. Researcher(独立研究员)
;
Univ. of Washington(华盛顿大学)
;
Ai2
;
NVIDIA(英伟达)
AI总结
Robometer通过结合轨迹内进步监督与轨迹间偏好监督,提升大规模机器人数据集中的奖励模型学习能力,实现更通用的奖励函数和更好的机器人学习性能。