The Great Pretender: A Stochasticity Problem in LLM Jailbreak
伟大的伪装者:大语言模型 jailbreak 中的一个随机性问题
机构 * Core contributors(核心贡献者)
专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI
AI总结 本文研究了大语言模型 jailbreak 中随机性对攻击成功率的影响,提出新的评估和生成框架,发现攻击成功率存在不稳定性且易被高估。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
伟大的伪装者:大语言模型 jailbreak 中的一个随机性问题
机构 * Core contributors(核心贡献者)
专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI
AI总结 本文研究了大语言模型 jailbreak 中随机性对攻击成功率的影响,提出新的评估和生成框架,发现攻击成功率存在不稳定性且易被高估。
EVA:针对对抗性攻击的多功能对齐编辑
机构 * ShanghaiTech University(上海科技大学) ; Sun Yat-sen University(中山大学) ; State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Tsinghua University(清华大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。
Comments IEEE TPAMI 2026
MetaBackdoor:利用位置编码作为大语言模型中的后门攻击面
机构 * Institute of Science Tokyo(东京科学研究院) ; Microsoft Azure(微软Azure) ; Microsoft Security Response Center(微软安全响应中心)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL
AI总结 本文提出MetaBackdoor,通过利用位置信息作为触发器,而非修改文本内容,实现对大语言模型的后门攻击,展示了长度相关的触发器可激活隐蔽后门,并展示了自我激活场景和与内容后门的组合攻击。
通过条件扩散系统发现在线地图构建中的语义攻击
机构 * University of Arizona(亚利桑那大学) ; Purdue University(普渡大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)
专题命中 越狱攻击 :safety(abstract);分类 cs.LG
AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。
Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用
机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) ; CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。
Comments 8 pages, 5 tables
在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御
机构 * Sichuan University(四川大学) ; Nanyang Technological University(南洋理工大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI
AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。
Comments 12 pages
对OpenClaw AI代理框架的安全性分析
机构 * SUCCESS Lab(SUCCESS实验室) ; Texas A&M University(德克萨斯大学)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。