GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
GUARD-SLM:基于令牌激活的对抗 Jailbreak 攻击防御方法用于小语言模型
机构 * Knight Foundation School of Computing and Information Sciences(奈特基金会计算与信息科学学院) ; Security, Optimization, and Learning for InterDependent networks laboratory (solid lab)(安全、优化与相互依赖网络学习实验室) ; Florida International University(佛罗里达国际大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了小语言模型在面对异构攻击时的脆弱性,提出GUARD-SLM方法通过分析隐藏层激活来过滤恶意提示,提升小语言模型的安全性。