One Bias After Another: Mechanistic Reward Shaping and Persistent Biases in Language Reward Models
一个接一个的偏差:语言奖励模型中的机械奖励塑造与持续偏差
机构 * Stanford University(斯坦福大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文通过系统测量五个高质量奖励模型中的偏差,发现长度、谄媚、过度自信等持续问题,并提出一种简单的后处理干预方法(机械奖励塑造)来减轻低复杂度偏差。
Comments ICML 2026 Camera-ready