Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning
Robo-ValueRL:离线到在线强化学习的可靠价值估计
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Beijing Forestry University(北京林业大学) ; Peking University(北京大学) ; Microsoft Research(微软研究院)
专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI
AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。
Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/