Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure
奖励偏差替代:单轴偏差缓解措施重定向优化压力
机构 * Stanford University(斯坦福大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出奖励偏差替代现象,即单轴缓解奖励模型偏差(如减少对长度、谄媚或风格的依赖)会将优化压力转移到相关代理上而非消除,并通过理论证明和实验(如GRPO训练中的长度惩罚导致过度自信)揭示了该问题,建议在评估中纳入策略诱导分布并跟踪多偏差。
Comments Improved readability (mostly appendix D)