Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation
基于双 oracle 效率的模型驱动强化学习:在策略优化和离线估计中的应用
机构 * Laboratory for Information and Decision Systems(信息与决策系统实验室) ; Massachusetts Institute of Technology(麻省理工学院) ; The University of Hong Kong(香港大学)
AI总结 本文提出一种新的算法,通过 log-barrier 和 log-determinant 正则化,在离线 oracle 效率的 episodic RL 中实现最优 regret 绑定,且 oracle 复杂度与状态和动作空间大小无关,适用于大规模和连续环境。