ARM: Advantage Reward Modeling for Long-Horizon Manipulation
ARM:用于长 horizon 操控的优势奖励建模
机构 * LimX Dynamics(LimX动力学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Zhejiang University(浙江大学)
专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出ARM框架,通过三态标签策略提升长 horizon 操控任务的奖励建模,实现高效稳定的数据利用。