Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs
黑盒、自适应、高效、可迁移、有害、适用……攻击是破解LLM所需的一切
机构 * University of St. Gallen(圣加尔大学)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 提出间接危害优化(IHO)方法,通过迭代偏好优化训练掩码扩散语言模型攻击器,实现黑盒、高效、可迁移的自适应攻击,显著提升对分层防御的破解成功率。