Entropy-Aware On-Policy Distillation of Language Models
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026