Average Reward Reinforcement Learning for Omega-Regular and Mean-Payoff Objectives
用于Ω-正则和平均收益目标的平均收益强化学习
机构 * King’s College London(伦敦大学国王学院) ; University of Colorado Boulder(科罗拉多大学波尔德分校) ; University of Birmingham, UK(英国伯明翰大学) ; MPI-SWS(马克斯·普朗克研究所(SWS))
AI总结 本文提出首个无模型强化学习框架,将绝对活性规范转化为平均收益目标,支持未知通信马尔可夫决策过程的学习,且在无episodic重置情况下收敛。
Comments 29 pages
Journal ref Journal of Artificial Intelligence Research 85, Article 25(March 2026)