SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
SAF-OPD:面向策略内蒸馏的稳定优势融合
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Meituan(美团) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Peking University(北京大学)
AI总结 该研究提出SAF框架解决RLVR与OPD固定系数融合的熵崩溃问题,通过四阶段机制优化优势融合,在7个推理与代码生成基准上提升模型性能与训练稳定性。
Comments Working in progress