When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?
当图文推理遇上安全:什么决定了多模态越狱鲁棒性?
机构 * Independent Researcher(独立研究者) ; Stanford University(斯坦福大学) ; Harvard University(哈佛大学) ; Purdue University(普渡大学) ; Duke University(杜克大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。
Comments 17 pages, 6 figures, 7 tables