Hierarchical Soft Actor-Critic for Sparse-Reward Long-Horizon Reinforcement Learning
用于稀疏奖励长视野强化学习的分层软演员-评论家算法
机构 * National Engineering School of Tunis, University of Tunis El Manar(突尼斯艾尔玛纳尔大学突尼斯国立工程师学校) ; University of Tripoli(的黎波里大学) ; University of Picardie Jules Verne Amiens(亚眠皮卡第朱尔斯·凡尔纳大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对稀疏奖励长视野强化学习挑战,提出两级分层强化学习框架,高级战略规划与低级SAC算法结合并利用熵正则化策略优化,经SAR-2数据集训练评估,HRL-SAC在多方面优于普通SAC,为相关任务提供有前途的解决方案。
Comments 27 pages, 6 figures, 11 Tables