Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes
离散动作非马尔可夫奖励决策过程中基于模型的强化学习
机构 * Fondazione Bruno Kessler(布雷诺·科塞拉基金会) ; Sapienza University of Rome(罗马萨皮恩扎大学)
AI总结 提出QR-MAX算法,通过奖励机分解马尔可夫转移学习与非马尔可夫奖励处理,首次在离散NMRDP中获得PAC收敛到ε-最优策略的多项式样本复杂度,并扩展至连续状态空间。
Comments Accepted at IJCAI-ECAI 2026. 19 pages, 32 figures, includes appendix