Knowledge- and Gradient-Guided Reinforcement Learning for Parametrized Action Markov Decision Processes
用于参数化动作马尔可夫决策过程的知识与梯度引导强化学习
机构 * HSU-AI Institute for Artificial Intelligence(HSU人工智能研究所)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 研究参数化动作马尔可夫决策过程中的强化学习,提出KGRL算法,利用领域知识修剪动作、约束参数空间,结合梯度细化参数,能提供局部解释并提高样本效率,优于现有强化学习基线。