arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-15 至 2026-05-15 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2605.14418 2026-05-15 cs.CR cs.AI 90%

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

伟大的伪装者:大语言模型 jailbreak 中的一个随机性问题

Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit

机构 * Core contributors(核心贡献者)

专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI

AI总结 本文研究了大语言模型 jailbreak 中随机性对攻击成功率的影响,提出新的评估和生成框架,发现攻击成功率存在不稳定性且易被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI 83%

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15172 2026-05-15 cs.CR cs.CL 57%

MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

MetaBackdoor:利用位置编码作为大语言模型中的后门攻击面

Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem

机构 * Institute of Science Tokyo(东京科学研究院) Microsoft Azure(微软Azure) Microsoft Security Response Center(微软安全响应中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出MetaBackdoor,通过利用位置信息作为触发器,而非修改文本内容,实现对大语言模型的后门攻击,展示了长度相关的触发器可激活隐蔽后门,并展示了自我激活场景和与内容后门的组合攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 57%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 57%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 57%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏