Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter
鲁棒的LLM去学习对抗重新学习攻击:表示中的次要成分至关重要
机构 * Shanghai University of Finance and Economics(上海金融学院) ; Alibaba Group(阿里巴巴集团) ; Southern University of Science and Technology(南方科技大学) ; Beihang University(北航)
专题命中 隐私与版权 :safety(abstract);分类 cs.CL
AI总结 本文研究了LLM去学习中对抗重新学习攻击的脆弱性,发现现有方法主要优化主导成分,而次要成分更抗反转。提出Minor Component Unlearning方法,通过聚焦稳健方向提升抗攻击能力。