arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 16 篇

2508.20325 2026-05-12 cs.CL cs.AI cs.CV 92%

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

GUARD:通过自适应角色扮演和 Jailbreak 诊断进行 LLM 的指南合规性测试

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Lapis Labs(Lapis实验室) Capital One

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 GUARD 通过自适应角色扮演和 Jailbreak 诊断,将指南转化为具体违规问题,验证 LLM 的合规性,经八种 LLM 测试验证有效性。

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09225 2026-05-12 cs.CR cs.AI cs.LG 92%

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

Jailbreak攻击的艺术:为LLM安全制定超越二进制评分的Jailbreak攻击

Ismail Hossain, Tanzim Ahad, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模组合式Jailbreak数据集、自动化生成方法及OPTIMUS评估器,系统性解决Jailbreak攻击的生成、分类与评估问题,揭示了安全与隐蔽最优区域。

Comments This paper is under review on of top security venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08778 2026-05-12 cs.AI cs.LG cs.MA 90%

Not All Turns Matter: Credit Assignment for Multi-Turn Jailbreaking

并非所有转折都重要:多轮 jailbreak 的信用分配

Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Xingcheng Xu, Dongrui Liu, Xia Hu, Chaochao Lu, Qiaosheng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :jailbreak(title_cn,summary_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 TRACE 框架,通过区分多轮 jailbreak 中不同回合的贡献,提升攻击效果和防御安全。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08513 2026-05-12 cs.CL cs.AI cs.LG 89%

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

单个神经元足以绕过大型语言模型的安全对齐

Hamid Kazemi, Atoosa Chegini, Maria Safi

机构 * Apple(苹果公司) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过针对单个神经元展示安全对齐的两种失效方向,证明在不训练或提示工程的情况下,通过抑制或放大特定神经元可绕过安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 85%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 82%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10611 2026-05-12 cs.CR cs.AI 79%

Re-Triggering Safeguards within LLMs for Jailbreak Detection

在大语言模型中重新触发安全机制以检测劫持

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Yuzhe Huang, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi'an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出一种大语言模型劫持提示检测方法,通过重新激活内部安全机制提升防御能力,实验表明其在白盒和黑盒环境下有效抵御最新劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08277 2026-05-12 cs.CR cs.AI 79%

Mitigating Many-shot Jailbreak Attacks with One Single Demonstration

通过一个单个演示缓解多示例劫持攻击

Kejia Chen, Jiawen Zhang, Boheng Li, Pengcheng Li, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI

AI总结 本文研究多示例劫持攻击为何随着演示数量增加而增强,提出通过添加固定单个安全演示来对抗该攻击,从而提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10133 2026-05-12 cs.CR cs.SE 71%

Usability as a Weapon: Attacking the Safety of LLM-Based Code Generation via Usability Requirements

可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性

Yue Li, Xiao Li, Hao Wu, Yue Zhang, Yechao Zhang, Yating Liu, Fengyuan Xu, Sheng Zhong

专题命中 越狱攻击 :safety(title)

AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08898 2026-05-12 cs.CL cs.AI 62%

LLM-Agnostic Semantic Representation Attack

不依赖特定大语言模型的语义表示攻击

Jiawei Lian, Jianhong Pan, Lefan Wang, Yi Wang, Tairan Huang, Shaohui Mei, Lap-Pui Chau

机构 * JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) Hong Kong Jockey Club Charities Trust(香港赛马会慈善信托基金) Global STEM Professorship Scheme of the Hong Kong Special Administrative Region (SAR)(香港特别行政区(SAR)的全球STEM教授计划) National Natural Science Foundation of China(中国国家自然科学基金委员会) Northwestern Polytechnical University(西北工业大学) The Hong Kong Polytechnic University(香港理工大学) School of Electronics and Information(电子与信息学院) Department of Electrical and Electronic Engineering(电气与电子工程系) Hong Kong Institute of AI for Science(香港人工智能科学研究院) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义表示攻击(SRA),通过重新定义对抗目标从精确文本到恶意语义,解决传统方法的收敛性、提示自然性和跨模型泛化问题,实现99.71%的攻击成功率。

Comments arXiv admin note: substantial text overlap with arXiv:2509.19360

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10582 2026-05-12 cs.CR cs.AI 57%

Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing

通过干扰-校正平滑实现保证的对抗防御

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :harmlessness(abstract);分类 cs.AI

AI总结 本文提出了一种基于平滑的新型防御方法,通过干扰-校正机制提升大语言模型对劫持攻击的防御能力,理论分析提供了防御成功的紧界和干扰强度要求,实验表明其在安全性和有用性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 57%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08460 2026-05-12 cs.CR cs.AI 57%

When Child Inherits: Modeling and Exploiting Subagent Spawn in Multi-Agent Networks

当子代理继承:在多代理网络中建模和利用子代理生成

Ziwen Cai, Yihe Zhang, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉弗奈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究多代理网络中子代理继承带来的安全风险,指出继承内存可能传播恶意指令,提出通过显式安全不变量进行防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09889 2026-05-12 cs.MA 50%

Skill Description Deception Attack against Task Routing in Internet of Agents

针对物联网代理中任务路由的技能描述欺骗攻击

Jiayi He, Xiaofeng Luo, Jiawen Kang, Ruichen Zhang, Jianhang Tang, Dong In Kim

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。

Comments Submitted to IEEE Globecom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09397 2026-05-12 cs.CR 50%

BadDLM: Backdooring Diffusion Language Models with Diverse Targets

BadDLM:针对扩散语言模型的多样化目标后门攻击研究

Shengfang Zhai, Xiaoyang Ji, Yuling Shi, Haoran Gao, Fanyu Meng, Yan Zeng, Yuejian Fang, Yinpeng Dong, Jiaheng Zhang

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出BadDLM框架,研究扩散语言模型的后门攻击,通过触发感知训练目标和理论证明,展示其在概念注入、语义属性引导等目标上的有效性,揭示扩散生成中的新安全风险。

Comments 21 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 越狱攻击 :safety(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏