Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs
潜在指令表示对齐:防御对抗性指令、后门和不期望知识在大语言模型中的攻击
机构 * ML Alignment & Theory Scholars(机器学习对齐与理论学者)
专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 本文提出LIRA方法,通过改变模型对指令的解释方式提升泛化能力,并通过内部对抗训练算法进一步增强泛化,有效防御了99%以上的PEZ对抗攻击,移除了一个具有挑战性的不安全代码后门,并在WMDP网络中实现最优遗忘。
Comments 33 pages, 6 figures