Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL
规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法
机构 * Scale AI ; University of Arizona(亚利桑那大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。
Comments 18 pages, 7 figures, 4 tables. Work in progress