Probe-Based Data Attribution: Discovering and Mitigating Undesirable Behaviors in LLM Post-Training
基于探针的数据归因:发现并缓解LLM微调后的不良行为
机构 * California Institute of Technology(加利福尼亚理工学院)
AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。