UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function
UFT:通过通用隐式奖励函数统一SFT和RLHF/DPO/UNA的微调
机构 * Salesforce ; RadixArk ; ChatAlpha AI ; University of North Texas(北卡罗来纳州立大学)
专题命中 指令微调 :SFT(title,title_cn);RLHF(title,title_cn);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 本文提出UFT框架,通过隐式奖励函数整合SFT与对齐过程,提升指令微调和事实性任务的性能,实验显示其优于传统方法。