RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
通过SFT方式实现RLHF:从最优解到奖励加权对齐
机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) ; Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);harmlessness(abstract)
AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。
Comments Published in TMLR-2026