Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models
结构化语义遮蔽用于大型语言模型的对抗攻击
机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) ; Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。
Comments 15 pages