RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer
RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏
机构 * Nanjing University(南京大学)
AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。
Comments 16 pages. Under review