Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision
自蒸馏零:自我修订将二元奖励转化为密集监督
机构 * Princeton University(普林斯顿大学) ; University of Toronto(多伦多大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出SD-Zero方法,通过让模型同时扮演生成器和修订者,利用二元奖励生成密集的token级自监督信号,显著提升训练样本效率,在数学和代码推理任务上超越RFT、GRPO等基线。