Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning
基于评分标准的强化学习中的奖励黑客行为的复现、分析与检测
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Xi’an Jiaotong University(西安交通大学)
AI总结 本文提出可控黑客环境CHERRL,通过注入已知偏见复现奖励黑客行为,分析其可发现性与可利用性,并探索基于智能体的自动检测方法。
Comments 23 pages, 7 figures