RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking
RankQ: 通过自监督动作排名实现离线到在线强化学习
机构 * Horizon Robotics(地平线机器人)
AI总结 该研究提出RankQ方法,通过自监督多项排名损失增强时序差分学习,以在大状态-动作空间中更准确地学习批评器,从而在稀疏奖励D4RL基准和基于视觉的机器人学习中实现更高效的离线到在线微调。
大厂专区
RankQ: 通过自监督动作排名实现离线到在线强化学习
机构 * Horizon Robotics(地平线机器人)
AI总结 该研究提出RankQ方法,通过自监督多项排名损失增强时序差分学习,以在大状态-动作空间中更准确地学习批评器,从而在稀疏奖励D4RL基准和基于视觉的机器人学习中实现更高效的离线到在线微调。