Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning
在线强化学习中延迟观测的极小化最优策略
机构 * University of California, Berkeley(加州大学伯克利分校) ; UC Berkeley(加州大学伯克利分校)
AI总结 针对延迟状态观测的强化学习问题,提出结合增广方法和上置信界算法的策略,在表格型MDP上达到极小化最优遗憾界。
Comments ICML camera ready version