Jailbreaking Vision-Language Models Through the Visual Modality
通过视觉模态 jailbreak 视觉-语言模型
机构 * Warsaw University of Technology(华沙理工大学) ; NASK National Research Institute(波兰国家研究研究院) ; University of Liverpool(利物浦大学) ; Indian Institute of Technology Roorkee(印度理工学院拉胡尔分校) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出四种利用视觉组件的 jailbreak 攻击,揭示了文本安全训练无法自动推广到视觉传达的有害意图,展示了视觉模态在安全对齐中的关键作用。
Comments Accepted to ICML 2026