Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
进入灰色区域:领域上下文可以模糊大语言模型安全边界
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);harmlessness(abstract)
AI总结 研究探讨了领域上下文如何模糊大语言模型的安全边界,提出Jargon框架通过多轮对抗交互提升攻击成功率,通过激活空间分析揭示灰色区域的不可靠性,并设计政策引导的防护策略以减少攻击成功率。
Comments ACL 2026 Main Conference