Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning
慢-快策略优化:在更新前重新定位用于大语言模型推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Manchester(曼彻斯特大学) ; NVIDIA ; Independent(独立) ; Emory University(埃默里大学)
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。
Comments Published as a conference paper at ICLR 2026