Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions
局部强化学习与基于动作的均方Q函数
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学)
AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。
Comments 18 pages, 11 figures