Safety Cost of Steering Vectors Is Separable and Reducible
引导向量的安全代价是可分离且可降低的
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。
Comments COLM 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
引导向量的安全代价是可分离且可降低的
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。
Comments COLM 2026
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
从正则表达式中分离大语言模型对齐:对抗性变异下的零覆盖率和度量相关散度
机构 * Vertex AI(顶点人工智能)
专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究在语料库被设计绕过正则表达式时大语言模型对齐情况,引入$L_5$-无正则表达式并评估,发现对齐贡献度量相关,自然语言探针中无额外覆盖率提升,对抗性变体中能检测到子串分类器错过的拒绝。
Comments 15 pages, 2 figures, 7 tables
安全对齐的LLM从混合顺从演示中学到了什么?
专题命中 越狱攻击 :safety(title);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 研究通过混合良性顺从演示和有害顺从演示,探究演示组成如何驱动有害顺从,发现演示内容、顺序和训练方法影响模型提取的信息。
智能体AI控制评估中的攻击选择显著降低安全性
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究攻击者策略性选择攻击时机对AI控制安全性的影响,通过分解攻击决策为开始和停止策略,实验表明两者均显著降低安全性,现有评估可能高估安全性。
作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI
AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。
Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696
针对多种防御策略的自动化越狱攻击
机构 * East China Normal University(东华大学) ; Shanghai Innovation Institute(上海创新研究院) ; University of Southampton(南安普顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; Software Engineering Institute, East China Normal University(东华大学软件工程研究院)
专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI
AI总结 提出UNIATTACK框架,从防御视角提取攻击特征并优化,实现跨模型和类别的单次黑盒攻击,显著提升成功率并降低开销。
对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱
机构 * Tsinghua University(清华大学) ; Harbin Engineering University(哈尔滨工程大学) ; Shandong University(山东大学) ; Xidian University(西安电子科技大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。
Comments Accepted by CVPR 2026 (Oral)
SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界
专题命中 越狱攻击 :safety(title,abstract)
AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。
基于硬件安全门控的LLM编写原生ARTIQ控制代码系统在离子阱平台上的应用
专题命中 越狱攻击 :safety(title,abstract)
AI总结 提出一种硬件安全门控系统,通过令牌授权机制确保LLM代理在离子阱实验中安全自主地编写和执行控制代码,并在实验中验证了其有效性和可移植性。
Comments 15 pages, 5 figures
从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。
GAS-Leak-LLM:基于遗传算法的后缀优化实现黑盒LLM越狱
机构 * Department of Electrical, Computer and Biomedical Engineering(电气、计算机与生物医学工程系) ; University of Pavia(帕维亚大学) ; Department of Computer Applications(计算机应用系) ; Cochin University of Science and Technology(科钦科学技术大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 提出GAS-Leak-LLM方法,利用遗传算法在黑盒设置下自动进化对抗后缀以绕过LLM安全约束,验证了现有安全机制的不足。
TYPO:针对商业闭源图像生成模型的指令密集型视觉越狱
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 研究针对商业闭源图像生成模型安全漏洞,提出TYPO框架,通过自动生成对抗性排版提示,利用文本和视觉双通道策略空间及自适应组合搜索,有效实现指令密集型视觉越狱,性能优于其他攻击且成本低。
通过信息过载对大型视觉语言模型进行越狱攻击
机构 * National University of Singapore(新加坡国立大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。
中间层知道什么:从熵动力学检测越狱
机构 * LMU Munich(慕尼黑大学) ; relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 康拉德·楚泽可靠人工智能卓越学校) ; University of Pisa(比萨大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; School of Engineering, Computing and Mathematics, Oxford Brookes University(牛津布鲁克斯大学工程、计算与数学学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过分析冻结LLM各层的token级预测熵轨迹,发现中间层的熵动力学特征(如基于排名的单调趋势分数)能有效检测越狱攻击,且无需额外训练。
Comments Accepted at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD) 2026. A short version accepted at EIML@ICML 2026
自进化LLM智能体系统中的安全性:威胁、放大与案例研究
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Hangzhou Dianzi University(杭州电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Fudan University(复旦大学)
专题命中 越狱攻击 :safety(title);分类 cs.AI
AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。
OTTER:一种用于规避毒性检测的越狱提示优化的红队系统
机构 * National Chengchi University, Taipei, Taiwan(国立中正大学,台北,台湾) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 越狱攻击 :jailbreak(title);分类 cs.CL
AI总结 提出OTTER系统,通过替换少量令牌解耦表面毒性与对抗意图,在四个GPT模型上将平均攻击成功率从7.0%提升至84.0%,并首次量化分析毒性-绕过关系。
普通人的越狱:通过多臂老虎机算法选择最优越狱以自动增强查询
机构 * Centre for Machine Intelligence and Data Science, IIT Bombay(印度理工学院班加罗尔机器智能与数据科学中心) ; Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔计算机科学与工程系)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG
AI总结 提出基于多臂老虎机框架的越狱攻击策略,在线学习最优越狱方法,并构建包含11,279个恶意查询的安全基准FrankensteinBench,实验表明对15个开源LLM平均成功率高达97%。
通过扩展训练时对抗攻击防御恶意微调
机构 * Xiongan AI Institute(雄安人工智能研究院) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Shanghai Qi Zhi Institute(上海期智研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 针对全参数微调的安全威胁,提出基于对抗训练和双层优化的Patcher方法,通过扩展对抗循环中的优化步数增强防御,并设计并行算法提升效率。
神经符号AI中的安全性、安全性和认知风险
专题命中 越狱攻击 :safety(title)
AI总结 本文系统分析了神经符号AI在五层架构中的攻击面,提出统一威胁模型、符号层威胁目录及认知风险分析,并通过三个实证基准验证了攻击的有效性与检测挑战。
Comments 28 pages, 1 figure, 10 tables
基于角色特征的涌现失配数据归因
机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。
语用攻击面:大语言模型中隐式上下文的漏洞
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出大语言模型存在语用攻击面漏洞,利用人类语言解读与安全对齐的隐式上下文不匹配,所提攻击方法在各类模型上的成功率大幅优于基线方法。
用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏
机构 * Clemson University(克莱姆森大学)
专题命中 越狱攻击 :alignment(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
ICO:通过迭代上下文优化增强语义偏移越狱攻击
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本研究针对现有语义偏移越狱攻击有效性有限的问题,提出带迭代上下文优化(ICO)的黑盒上下文感知框架,经多数据集与多模型实验,其攻击效果优于现有基线,平均成功率达74.6%。
安全智能体AI:从单步行动检查到轨迹保障
机构 * Purdue University(普渡大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该研究围绕自主智能体安全领域,梳理了单智能体、多智能体及宏观层面的各类安全挑战,提出安全需成为智能体架构等的可验证属性,为可信自主智能体部署提供路线图。
Comments 6 pages. Accepted to the ACM AI Leadership Summit 2026 (Visionary Track)
MJ:通过分解信用分配实现多轮语言模型越狱
机构 * POSTECH GSAI(浦项科技大学全球人工智能学院) ; Samsung SDS(三星 SDS)
专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.CL
AI总结 研究针对多轮语言模型越狱的信用分配难题,提出DC-GRPO框架,通过结合即时和未来信用为各轮次分配学习信号,经静态和动态加权规则实例化,在多模型和基准测试中显著优于现有方法,核心优势在于轮次级组相对信用分配。
Comments 29 pages. Warning: This paper contains examples of harmful content
通过内部归因图对大语言模型越狱进行机制性可解释性研究
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。
超越提示:通过模拟审核轨迹越狱函数调用大语言模型
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。
SafeSpec: 通过动态反射采样实现快速且安全的LLM
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; Huawei(华为) ; Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 提出SafeSpec框架,将轻量安全头集成到推测解码的验证过程中,通过风险估计和反射采样恢复安全生成,在保持加速的同时显著降低攻击成功率。
CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应
专题命中 越狱攻击 :alignment(abstract);safety(abstract)
AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。