DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models
DASH:用于推理模型在线自蒸馏的 divergence-adaptive 监督视界
专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI
AI总结 针对标准在线自蒸馏(OPSD)未充分利用 rollout 时间结构的局限,提出 DASH 方法,通过自适应传播门调整 token 级监督权重,在三类数学推理基准、三种模型规模上均优于 vanilla OPSD,且无需额外前向传播。
Comments 17 pages, 4 figures, 9 tables. Code at https://github.com/DBtxy/DASH-OPSD