Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment
通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击
机构 * Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学) ; Shenzhen MSU-BIT University(深圳MSU-BIT大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)
AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。