MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training
MOPD: 面向LLM后训练中能力集成的多教师同策略蒸馏
机构 * Peking University(北京大学) ; LLM Core Xiaomi(小米大模型核心团队) ; University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出多教师同策略蒸馏(MOPD)范式,通过先训练领域专家再在学生自生成数据上蒸馏,消除暴露偏差并提供密集优化信号,在Qwen3-30B-A3B上优于多种基线,并已部署于工业级模型MiMo-V2-Flash。