Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
迈向通用且可迁移的视觉-语言模型劫持攻击
机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) ; School of Information Technology, Deakin University, Australia(德肯大学信息科技系) ; Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。
Comments ICLR 2026