Reward Model Overoptimisation in Iterated RLHF
机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) ; Department of Computer Science(计算机科学系) ; University College London(伦敦大学学院) ; UK AI Security Institute(英国人工智能安全研究所) ; Department of Computer Science and Engineering(计算机科学与工程系) ; University of Bologna(博洛尼亚大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 24 pages, 17 figures, 6 tables