Trace-Based On-Policy Distillation for Masked Diffusion Language Models
基于轨迹的策略蒸馏用于掩码扩散语言模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)
AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。