Sparse Autoencoders are Capable LLM Jailbreak Mitigators
稀疏自编码器是LLM劫持攻击缓解器
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出基于SAE的CC-Delta方法,通过比较带有和无劫持上下文的有害请求的token级表示,识别劫持相关的稀疏特征,从而在稀疏SAE特征空间中实现更优的安全-效用权衡。
Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026. 31 pages, 20 figures, 7 tables