Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode
扩散模型更安全,但受上下文影响而失效:扩散大语言模型的安全祝福及其失效模式
机构 * Torr Vision Group, University of Oxford(牛津大学Torr视觉组) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft(微软)
AI总结 研究探讨了扩散大语言模型(D-LLMs)在生成效率上的优势及其安全特性,发现其扩散生成方式增强了对对抗攻击的抵抗力,但存在上下文嵌套等失效模式,首次成功突破Gemini Diffusion的安全防线。