When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming
当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类
机构 * First Citizens Bank(第一公民银行) ; Alma Mater Europaea University(欧洲大学)
专题命中 偏好对齐 :RLHF(title,title_cn);DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。
Comments 20 pages, 8 figures; includes code, artifacts, and live demo