Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges
大模型时代的奖励黑客:机制、涌现偏差、挑战
机构 * Fudan NLP Group(复旦大学NLP小组)
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本文探讨大模型中奖励黑客的机制与挑战,提出代理压缩假说框架,分析优化过程中的表现偏差和对抗性行为,提出检测与缓解策略。
Comments 42 pages, 5 figures, 2 tables