arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

2026-04-23 至 2026-04-23 共收录 1
2506.20904 2026-04-23 cs.LG cs.IT math.IT math.OC stat.ML

Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL

平均回报离线强化学习中单策略样本复杂度与瞬时覆盖的最优性

Matthew Zurek, Guy Zamir, Yudong Chen

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文研究了平均回报MDP中的离线强化学习,提出基于目标策略的精确样本复杂度界,并首次处理一般弱连通MDP,引入改进的悲观折扣价值迭代算法。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏