Exploring and Developing a Pre-Model Safeguard with Draft Models
探索和开发预模型安全防护机制
机构 * Purdue University(普渡大学) ; Florida International University(佛罗里达国际大学)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。
Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)