Calibrating Post-Training Feature Shifts for LLM Data Contamination Detection
校准用于大语言模型数据污染检测的训练后特征偏移
机构 * The University of New South Wales(新南威尔士大学)
专题命中 后训练与偏好优化 :LLM(title,summary_cn);post-training(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对训练后处理导致的LLM数据污染检测中特征偏移问题,提出CalibDCD校准框架,经实验可提升现有检测器的AUC和TPR@5%FPR指标。
Comments 14 pages, 7 figures. The first two authors contributed equally