HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models
HARVE:面向鲁棒奖励模型的感知黑客奖励头向量编辑
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Virginia(弗吉尼亚大学) ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; University of Michigan(密歇根大学) ; New Jersey Institute of Technology(新泽西理工学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 针对奖励模型易受奖励黑客攻击的问题,提出无需训练的奖励头编辑方法HARVE,通过移除与黑客相关子空间对齐的奖励头向量分量,提升鲁棒性并保持通用能力。