RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning
RASFT: 用于推理的滚动自适应监督微调
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; New Jersey Institute of Technology(新泽西理工学院) ; Institute of Computing Technology, CAS(中国科学院计算技术研究所)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。