Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization
通过扩散策略优化扩展世界模型强化学习
机构 * Dynamic Systems Lab, University College London(伦敦大学学院动态系统实验室) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Santa Fe Institute(圣塔菲研究所) ; School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) ; Department of Computing, Imperial College London(伦敦帝国理工学院计算系)
专题命中 扩散模型 :diffusion(title,abstract)
AI总结 针对世界模型强化学习中搜索与价值学习之间的结构错位问题,提出基于扩散策略优化的模型基方法MBDPO,统一搜索与策略优化,实现可扩展的策略学习。