WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
WARP-RM: 一种用于数据筛选的扭曲增强相对进度奖励模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; XDOF
AI总结 提出WARP-RM,通过时间扭曲增强从成功演示中自监督学习密集相对进度信号,用于行为克隆中加权高优势动作块,在机器人叠衣任务中显著提升数据效率。