Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。