Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement
明文之中隐藏:通过激活解耦检测隐蔽的 jailbreak
机构 * Duke University(杜克大学) ; Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind) ; Apple(苹果公司)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 通过解耦 LLM 激活中的语义因子,提出 FrameShield 异常检测器,提升对隐蔽 jailbreak 的检测能力,并推动 LLM 安全和可解释性研究。