Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs
隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡
机构 * NC State University(北卡罗来纳州立大学) ; Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。
Comments 39 pages, including appendices