Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing
通过样本路由统一组相对和自蒸馏策略优化
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; Tencent(腾讯) ; Wuhan AI Research(武汉人工智能研究院)
AI总结 本文提出SRPO框架,通过样本路由整合GRPO和SDPO的优势,解决自蒸馏在长期训练中的稳定性问题,实现快速早期改进与长周期稳定性的结合。