Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
稀疏令牌足矣:通过令牌感知梯度优化越狱音频语言模型
机构 * Wuhan University ; Institute for Math \& AI, Wuhan University ; Huazhong University of Science ; Shanghai Jiao Tong University ; Xidian University
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出令牌感知梯度优化(TAGO)方法,通过仅保留高梯度能量的音频令牌对应的波形梯度,实现稀疏越狱攻击,在保持高成功率的同时大幅减少优化量。
Comments To appear in the 43rd International Conference on Machine Learning (ICML 2026)