Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL
平均回报离线强化学习中单策略样本复杂度与瞬时覆盖的最优性
机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)
AI总结 本文研究了平均回报MDP中的离线强化学习,提出基于目标策略的精确样本复杂度界,并首次处理一般弱连通MDP,引入改进的悲观折扣价值迭代算法。
Journal ref NeurIPS 2025