fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum
fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习
机构 * OPPO AI Center(OPPO人工智能中心)
AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。
大厂专区
fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习
机构 * OPPO AI Center(OPPO人工智能中心)
AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。