Backpropagating Through Simulation: Analytic Policy Gradients for Sample and Learning Efficient Differentiable Continuous Control
通过仿真反向传播:用于样本高效和学习高效的可微连续控制的解析策略梯度
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 提出解析策略梯度(APG)方法,利用可微环境动力学通过仿真反向传播计算精确梯度,在四个连续控制任务中与PPO对比,显著提升样本效率。