GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization
GIFT:通过有限温度吉布斯初始化调和后训练目标
机构 * Peking University(北京大学) ; Meituan(美团)
专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。