Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits
扩散大语言模型作为目标与对抗者:机制性安全漏洞利用
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。