arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

字节Seed、清华提出Open-MOPD:多教师能力恢复率升至83.4%

arXiv 2608.19098 cs · cs.AI · cs.CL · cs.LG

把数学、代码、指令遵循等多个强化学习专家蒸馏到一个学生模型,短答案任务可能先停滞,长答案领域却持续占用大部分Token更新。清华大学AIR、字节Seed提出Open-MOPD,在SmolLM3-3B-Base的受控实验中,把相对路由专家集合的能力恢复率从35.6%提高到83.4%。

实验使用oracle路由,让每个样本都交给正确教师,先排除路由错误。结论因此聚焦“能力如何合并”,不能直接外推到路由本身不可靠或模型规模完全不同的生产系统。

标准蒸馏只吃到了35.6%的可用提升

多教师在线蒸馏让学生自己生成回答,领域教师对学生访问到的Token逐个打分,再用密集奖励更新同一个模型。理想上,它应接近按领域选择专家的RouteRL集合,同时保留单模型部署成本。

受控基准中,朴素M-OPD的综合分为28.05,只恢复RouteRL相对混合SFT可用提升的35.6%;Open-MOPD综合分升到31.24,恢复率达到83.4%。能力整合差距从3.50分缩小到0.31分。

朴素蒸馏与Open-MOPD整合差距

项目结果图:朴素M-OPD与Open-MOPD相对混合SFT和按领域路由专家的能力差距。

真正抢预算的是Token数量,不是样本数量

不同领域的回答长度差异很大。即使每个领域抽到同样多提示,长链推理产生的Token更多,梯度份额也更大;指令遵循等简短任务很快被挤到边缘。论文测到教师梯度存在分歧,但它不是主要瓶颈。

样本频率与Token梯度份额

项目图:提示采样频率相同并不保证各领域获得相同的梯度Token份额。

Open-MOPD先做Token-share balancing,按实际生成长度重分配更新量,让每个领域获得目标Token份额。这个修复处理结构性长度差,但训练继续后,各领域收敛速度又会变化。

已经学会的领域不该继续拿走固定份额

某个领域接近教师水平后,继续分配同样更新预算收益很低;落后领域反而需要更多梯度。第二项机制根据学生与领域专家的差距动态调预算,差距缩小时自动降低份额,避免训练在第74步出现预算集中到已收敛领域的情况。

领域差距变化引起的预算漂移

项目图:不同领域收敛速度不一,固定Token平衡仍会让有效训练预算逐渐偏离需求。

这种动态分配依赖可比较的领域差距指标。真实业务里若领域评测噪声大、样本难度不一致,预算信号也可能被误导,需要为每个领域保存独立验证集。

学生已经变了,旧奖励也要刷新

在线蒸馏一次采样后可能做多步策略更新。学生参数变化后,缓存的学生概率来自旧策略,教师—学生奖励会变得陈旧。Open-MOPD在每个梯度步前重算学生概率,同时缓存教师状态,降低额外计算。

教师评分与学生访问状态

项目方法图:教师只为学生实际访问的状态评分,并不生成示范答案;学生概率在更新中被刷新。

三项机制分别处理长度、收敛速度和多步更新陈旧度。论文开放训练方案、轨迹和评测套件,强调可在学术可及硬件预算上复现;具体硬件、训练时长与能耗仍应随复现实验一起报告。

下一步要从受控路由走向真实专家系统

Open-MOPD适合把多个后训练专家合成一个通用模型,减少按请求加载不同权重的部署复杂度。下一步要把oracle路由换成可犯错的路由器,观察错误教师评分会不会破坏已经平衡的预算。

还需要扩大教师之间的差异:当前分析围绕数学、代码和指令遵循三个领域,教师目标相对清晰。若教师对同一请求给出冲突风格、安全边界或事实判断,按领域分配Token预算并不能自动解决目标冲突。

83.4%是相对各教师上限计算的能力恢复率,不是所有任务上的绝对正确率。它说明训练配方更充分地利用了现有教师信号,但学生仍受自身容量、路由质量和评测覆盖范围限制。

还需扩展到更大模型、更多领域和相互矛盾的安全策略,并比较动态预算是否稳定。当前结果说明多教师整合失败不一定是“专家意见打架”,Token级训练资源如何分配同样决定最终能力组合。

参考资料

https://arxiv.org/abs/2608.19098

https://bytedtsinghua-sia.github.io/Open-MOPD/