Efficient Reinforcement Learning by Guiding World Models with Non-Curated Data
通过非策划数据引导世界模型的高效强化学习
机构 * Aalto University(阿alto大学) ; University of Edinburgh(爱丁堡大学) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Deep Render ; Imperial College London(伦敦帝国理工学院) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; CIFAR AI Chair(CIFAR人工智能主席) ; University of Alberta(阿尔伯塔大学) ; Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所(Amii)) ; University of Oulu(奥卢大学)
专题命中 模仿学习与强化学习 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出利用无奖励、混合质量、多本体的非策划离线数据,通过经验回放和执行引导技术解决分布偏移问题,显著提升在线强化学习的样本效率。