GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
GIFT: 组相对隐式微调整合GRPO与DPO和UNA
机构 * Inflection AI
专题命中 偏好对齐 :DPO(title,title_cn);RLHF(summary_cn,abstract);分类 cs.CL、cs.LG
AI总结 GIFT结合GRPO组采样、DPO隐式奖励和UNA的隐式与显式优势MSE,通过z-score标准化消除DPO隐式奖励中的不可行分区函数Z(x)和RLHF/RLVR目标中的KL系数β,以组相对隐式微调解决相同参数策略族,用提示适应的β(x)替代外部调优的β。