Relative Entropy Pathwise Policy Optimization
相对熵路径策略优化
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; TU Wien(维也纳工业大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Warsaw(华沙大学) ; UC Berkeley(加州大学伯克利分校) ; Polytechnique Montréal(蒙特利尔综合理工学院) ; Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所)
AI总结 本文提出REPPO算法,通过路径策略梯度结合在线学习,提升训练稳定性与效率,展现优越的样本效率和内存表现。