ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate
ACPO:通过细粒度替代熵实现自适应信用策略优化
机构 * Peking University(北京大学) ; Baidu Inc.(百度公司) ; Kuaishou Inc(快手公司)
AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。