Offline Policy Optimization with Posterior Sampling
离线策略优化与后验采样
机构 * Zhejiang University(浙江大学) ; Xi’an Jiaotong University(西安交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Science and Technology Beijing(北京科技大学)
AI总结 本文提出PSPO方法,通过将动态建模作为贝叶斯推断过程,结合后验采样与约束策略优化,提升离线强化学习的泛化能力与鲁棒性。
Comments 25 pages, 3 figures