arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Horizon Robotics(地平线机器人)

2026-05-21 至 2026-05-21 共收录 1
2605.11151 2026-05-21 cs.AI cs.RO

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ: 通过自监督动作排名实现离线到在线强化学习

Andrew Choi, Wei Xu

机构 * Horizon Robotics(地平线机器人)

AI总结 该研究提出RankQ方法,通过自监督多项排名损失增强时序差分学习,以在大状态-动作空间中更准确地学习批评器,从而在稀疏奖励D4RL基准和基于视觉的机器人学习中实现更高效的离线到在线微调。

详情

展开后加载摘要…

URL PDF HTML 收藏