Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics
通过流形轨迹动力学防御大语言模型的越狱攻击
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)
AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。
Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk