Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning
重新思考在LLM后训练中专家轨迹的利用
机构 * Zhejiang University(浙江大学) ; School of Engineering, Westlake University(西湖大学工程学院) ; Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出Plasticity-Ceiling框架,通过分解最终性能上限,揭示SFT与RL的协同优化方法,建立SFT-然后-RL的流水线,解决同步方法的稳定性问题,并提供精确的缩放指南。
Comments ACL-26, Main Conference