Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling
教会奖励模型自我修正:奖励引导的对抗性失败发现以实现鲁棒奖励建模
机构 * University of Maryland College Park(马里兰大学College Park分校) ; Capital One
AI总结 提出REFORM框架,通过奖励引导的受控解码自动发现奖励模型失败模式,并利用生成的对抗样本自我改进,提升鲁棒性而不牺牲奖励质量。
Journal ref ACL 2026 Main Conference [Oral]