Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性
机构 * Wuhan University(武汉大学) ; Nanyang Technological University(南洋理工大学) ; Southeast University(东南大学) ; University of Hong Kong(香港大学)
专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。