Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks
通过扩展训练时对抗攻击防御恶意微调
机构 * Xiongan AI Institute(雄安人工智能研究院) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Shanghai Qi Zhi Institute(上海期智研究院)
专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。