DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models
DiffuGuard: 差分扩散语言模型中内在安全的丧失与恢复
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Squirrel Ai Learning(松鼠AI) ; Peking University(北京大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了差分扩散语言模型在对抗攻击中的脆弱性,提出DiffuGuard框架通过随机退火重标记和块级审计修复提升模型安全性,有效降低攻击成功率。
Comments Accepted by ICLR2026