arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Scale AI

2026-08-13 至 2026-08-13 共收录 1
2608.11669 2026-08-13 cs.LG cs.AI cs.CL 新提交

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法

Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu

机构 * Scale AI University of Arizona(亚利桑那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。

Comments 18 pages, 7 figures, 4 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏