Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
面向大型语言模型中对抗性后缀的可迁移性理解
机构 * Ludwig-Maximilians-Universität München(慕尼黑莱布尼茨-马克斯大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学)
AI总结 该研究针对大型语言模型的对抗性后缀可迁移性,分析出三个与迁移成功高度相关的统计属性,其成果可用于提升越狱攻击的实际效果。
Comments Accepted at TMLR 2026