Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning
占用奖励塑造:改进离线目标导向强化学习中的信用分配
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学) ; INFIFORCE Intelligent Technology(INFIFORCE智能技术) ; Princeton University(普林斯顿大学)
专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.RO
AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。
Comments ICLR 2026