Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
在大型语言模型后训练强化学习中检测数据污染
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; New H3C Technologies Co., Ltd(新华H3C技术有限公司)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract)
AI总结 本文提出Self-Critique方法,通过分析LLM后强化学习阶段输出熵分布的变化来检测数据污染,实验表明其在多个模型和污染任务中显著优于基线方法,AUC提升达30%。
Comments Accepted to ICLR 2026. Code is available at https://github.com/yongding-tao/RL-Data-Contamination