ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts
ConceptGuard: 通过稀疏可解释的禁用概念实现神经符号安全防护
机构 * Department of Computer Science, Université Paris-Saclay(巴黎萨克雷大学计算机科学系) ; MICS, CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学MICS)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 ConceptGuard通过稀疏自编码器识别可解释概念,构建可解释且可推广的安全防护,提升LLM对抗禁用攻击的能力。