A Statistical Framework for Alignment with Biased AI Feedback
带有偏见AI反馈的统计框架
机构 * Center for Data Science, Zhejiang University(浙江大学数据科学中心) ; Department of Electrical and Computer Engineering, Rutgers University(罗格斯大学电气与计算机工程系) ; Department of Statistics, Rutgers University(罗格斯大学统计学系) ; Faculty of Business and Economics, The University of Hong Kong(香港大学商学院)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文提出两种去偏对齐方法,DDPO通过残差修正和密度比重加权提升效率,DIPO直接估计人类偏好概率,实验证明其在情感生成、摘要和对话任务中提升了对齐效率并接近全人类标注数据性能。