Proximal Point Nash Learning from Human Feedback
基于人类反馈的近端点纳什学习
机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) ; LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) ; Google DeepMind(谷歌DeepMind) ; Duisburg-Essen University(杜伊斯堡-埃森大学) ; HSE University(俄罗斯高等经济大学) ; Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) ; LRE EPITA(EPITA LRE) ; Hugging Face ; Isara Labs(Isara实验室) ; ENS Lyon(里昂大学)
AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。