Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code
语法约束解码可诱使大语言模型生成恶意代码
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文发现语法约束解码(GCD)可被利用发起名为CodeSpear的越狱攻击,使LLM生成恶意代码;并提出安全对齐方法CodeShield,通过生成蜜罐代码防御该攻击。