EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms
EvalStop:利用世界反馈检测和纠正多租户RLHF平台中的奖励过度优化
机构 * DeepMind, London, UK(深度Mind, 英国伦敦) ; University of Cambridge, UK(英国剑桥大学) ; University of Washington, USA(美国华盛顿大学)
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出EvalStop调度原语,通过检测评估分数连续下降来终止作业、释放GPU并保留最佳检查点,以纠正奖励过度优化,在RLHF负载上实现高精度检测并提升JCT。