arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2407.16205 2025-06-19 cs.CR cs.AI cs.CL cs.LG 87%

LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models

Shi Lin, Hongming Yang, Rongchang Li, Xun Wang, Changting Lin, Wenpeng Xing, Meng Han

机构 * Zhejiang Gongshang University(浙江工商大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19440 2025-04-29 cs.CR 87%

JailbreaksOverTime: Detecting Jailbreak Attacks Under Distribution Shift

Julien Piet, Xiao Huang, Dennis Jacob, Annabella Chow, Maha Alrashed, Geng Zhao, Zhanhao Hu, Chawin Sitawarin, Basel Alomair, David Wagner

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)

Comments 18 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13603 2025-02-26 cs.CL cs.AI cs.LG 87%

Efficient Safety Retrofitting Against Jailbreaking for LLMs

Dario Garcia-Gasulla, Adrian Tormos, Anna Arias-Duart, Daniel Hinjos, Oscar Molina-Sedano, Ashwin Kumar Gururajan, Maria Eugenia Cardello

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04295 2024-09-02 cs.CR cs.AI cs.CL cs.LG 87%

Jailbreak Attacks and Defenses Against Large Language Models: A Survey

Sibo Yi, Yule Liu, Zhen Sun, Tianshuo Cong, Xinlei He, Jiaxing Song, Ke Xu, Qi Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03603 2024-08-08 cs.CR cs.AI cs.CL cs.LG 87%

EnJa: Ensemble Jailbreak on Large Language Models

Jiahao Zhang, Zilong Wang, Ruofan Wang, Xingjun Ma, Yu-Gang Jiang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06407 2024-05-08 cs.CL cs.AI cs.CR cs.LG 87%

Rethinking How to Evaluate Language Model Jailbreak

Hongyu Cai, Arjun Arunasalam, Leo Y. Lin, Antonio Bianchi, Z. Berkay Celik

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02949 2023-10-05 cs.CL cs.AI cs.CR cs.LG 87%

Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models

Xianjun Yang, Xiao Wang, Qi Zhang, Linda Petzold, William Yang Wang, Xun Zhao, Dahua Lin

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03235 2025-03-26 cs.CL cs.AI 87%

Does Safety Training of LLMs Generalize to Semantically Related Natural Prompts?

Sravanti Addepalli, Yerram Varun, Arun Suggala, Karthikeyan Shanmugam, Prateek Jain

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

Comments Accepted in ICLR 2025

Journal ref Addepalli, S., Varun, Y., Suggala, A., Shanmugam, K., & Jain, P. (2025). Does safety training of LLMs generalize to semantically related natural prompts? In The Thirteenth International Conference on Learning Representations 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24191 2026-08-11 cs.CR cs.AI 版本更新 86%

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

当语法引导攻击:利用结构化输出揭示LLM中的控制平面漏洞

Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

机构 * SKLP, ICT, CAS & UCAS(SKLP、信息科技研究院、中国科学院及中国科学院大学) University of Aberdeen(阿伯丁大学) University of Leeds(利兹大学) SKLP, ICT, CAS(SKLP、信息科技研究院、中国科学院)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了通过结构化输出揭示LLM控制平面漏洞的问题,提出了一种名为Constrained Decoding Attack(CDA)的新类别的 jailbreak 方法,通过控制到语义的管道机制,利用schema-enforced logit masking注入恶意前缀,并由模型自身完成有害意图,展示了DictAttack在多个模型上的高攻击成功率,揭示了需要跨平面防御来弥合数据和控制平面之间的语义差距。

Comments To appear in CCS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19321 2026-05-20 cs.CR cs.AI 86%

Exploring and Developing a Pre-Model Safeguard with Draft Models

探索和开发预模型安全防护机制

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。

Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 86%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20956 2026-04-30 cs.CR cs.CL 86%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02356 2026-04-21 cs.CR cs.LG 86%

ASTRA: An Automated Framework for Strategy Discovery, Retrieval, and Evolution for Jailbreaking LLMs

ASTRA:一种用于对抗大语言模型 jailbreak 的自动化框架

Xu Liu, Yan Chen, Kan Ling, Yichi Zhu, Hengrun Zhang, Guisheng Fan, Huiqun Yu

机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(东华大学信息科学与工程学院,上海,中国)

专题命中 越狱攻击 :jailbreak(title_cn,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 ASTRA 提出了一种自动化框架,通过闭环机制自动发现、检索和演化攻击策略,提升攻击策略的多样性和适应性。

Comments Acccepted by ACL 2026, 20 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09063 2025-04-17 cs.LG 86%

Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space

Leo Schwinn, David Dobre, Sophie Xhonneux, Gauthier Gidel, Stephan Gunnemann

专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.LG

Comments Trigger Warning: the appendix contains LLM-generated text with violence and harassment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07430 2026-08-10 cs.LG cs.AI 新提交 86%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19424 2026-07-23 cs.CR cs.AI cs.CL 新提交 86%

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

JailMeter:一种基于证据的大语言模型越狱攻击评估框架

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09629 2026-06-22 cs.CR cs.AI cs.CY cs.ET cs.HC 86%

Stop Testing Attacks, Start Diagnosing Defenses: The Four-Checkpoint Framework Reveals Where LLM Safety Breaks

停止测试攻击,开始诊断防御:四检查点框架揭示LLM安全为何破裂

Hayfa Dhahbi, Kashyap Thimmaraju

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);分类 cs.AI、cs.CY

AI总结 本文提出四检查点框架,通过输入输出阶段和检测级别两个维度分析LLM安全机制,揭示防御漏洞所在及原因,提出WASR指标评估安全性能。

Comments 17 pages, pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12445 2026-06-16 cs.AI cs.LG stat.ML 版本更新 86%

Computational Safety for Generative AI: A Hypothesis Testing Perspective

生成式AI的计算安全性:假设检验视角

Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。

Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11817 2026-06-11 cs.CR cs.AI cs.CL cs.SE 新提交 86%

Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code

语法约束解码可诱使大语言模型生成恶意代码

Yitong Zhang, Shiteng Lu, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文发现语法约束解码(GCD)可被利用发起名为CodeSpear的越狱攻击,使LLM生成恶意代码;并提出安全对齐方法CodeShield,通过生成蜜罐代码防御该攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20654 2026-06-04 cs.LG cs.AI 86%

REFLECTOR: Internalizing Step-wise Reflection against Indirect Jailbreak

REFLECTOR: 内化逐步反思以对抗间接越狱

Jiachen Ma, Jiawen Zhang, Xiangtian Li, Bo Zou, Chaochao Lu, Chao Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出REFLECTOR两阶段框架,通过教师引导生成反思数据并进行监督微调,再结合强化学习内化自主反思能力,在复杂间接攻击下实现超过90%的防御成功率,同时提升通用性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06655 2026-05-18 cs.LG cs.AI 86%

Graph-Regularized Sparse Autoencoders for LLM Safety Steering

图正则化稀疏自编码器用于LLM安全引导

Jehyeok Yeon, Federico Cinus, Yifan Wu, Luca Luceri

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Intesa Sanpaolo(Intesa Sanpaolo公司) University of Southern California(南加州大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出图正则化稀疏自编码器,通过在神经元共激活图上平滑解码器向量并应用方向库,提升安全引导效果,在多个基准测试中显著提高有害请求拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15725 2026-04-20 cs.LG cs.AI 86%

Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing

通过语义触发和心理框架针对大推理模型的推理定向劫持攻击

Zehao Wang, Lanjun Wang

机构 * College of Intelligence and Computing(智能与计算学院) School of New Media and Communication(新媒体与传播学院) Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRJA框架,通过语义触发选择模块和心理指令生成模块,解决大推理模型推理过程中的安全问题,实验显示在五个问答数据集上攻击成功率达83.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02574 2026-04-06 cs.CR cs.AI cs.LG 86%

Understanding the Effects of Safety Unalignment on Large Language Models

理解安全对齐偏差对大语言模型的影响

John T. Halloran

机构 * Leidos(Leidos公司)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 研究通过JT和WO方法评估六种大模型在恶意和良性任务中的表现,发现WO方法使模型更易执行恶意活动,而JT方法则更易产生幻觉。通过监督微调有效限制WO带来的攻击能力。

Comments 12 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23509 2026-03-26 cs.CL cs.AI cs.CR 86%

Internal Safety Collapse in Frontier Large Language Models

前沿大语言模型中的内部安全崩溃

Yutao Wu, Xiao Liu, Yifeng Gao, Xiang Zheng, Hanxun Huang, Yige Li, Cong Wang, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Deakin University(德克萨斯大学) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) City University of Hong Kong(香港城市大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了前沿大语言模型中一种关键故障模式——内部安全崩溃,通过构建ISC-Bench测试集,发现模型在执行某些任务时会持续生成有害内容,且比传统劫持攻击更危险。

Comments 15 pages of the main text, qualitative examples of jailbreaks may be harmful in nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23268 2026-03-25 cs.LG cs.AI 86%

SafeSeek: Universal Attribution of Safety Circuits in Language Models

SafeSeek: 语言模型中安全回路的通用归因

Miao Yu, Siyuan Fu, Moayad Aloqaily, Zhenhong Zhou, Safa Otoum, Xing fan, Kun Wang, Yufei Guo, Qingsong Wen

机构 * University of Science United Arab Emirates University Nanyang Technological University Zayed University Intelligent Science \& Technology Academy of CASIC

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSeek框架,通过优化识别语言模型中的完整安全回路,验证了在后门攻击和安全对齐场景中的有效性,展示了安全回路的识别与利用方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05773 2026-03-16 cs.CR cs.AI cs.LG 86%

Knowing without Acting: The Disentangled Geometry of Safety Mechanisms in Large Language Models

Jinman Wu, Yi Xie, Shen Lin, Shiqian Zhao, Xiaofeng Chen

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08234 2026-03-10 cs.AI cs.LG 86%

The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs

延续与拒绝之间的斗争:对LLMs中延续触发突破的机理分析

Yonghong Deng, Zhen Yang, Ping Jian, Xinyue Zhang, Zhongbin Guo, Chengzhi Li

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs中延续触发突破现象,揭示了模型内在延续驱动与安全防御之间的竞争机制,为提升模型安全性提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22067 2026-02-17 cs.LG cs.AI 86%

The Rogue Scalpel: Activation Steering Compromises LLM Safety

恶意手术刀:激活引导破坏了大语言模型的安全性

Anton Korznikov, Andrey Galichin, Alexey Dontsov, Oleg Y. Rogov, Ivan Oseledets, Elena Tutubalina

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现激活引导技术实际上会破坏大语言模型的安全性,通过实验表明即使随机引导也能增加有害服从的概率,挑战了可解释性带来的安全假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04039 2026-02-10 cs.CL cs.AI cs.CR 86%

Large Reasoning Models Are Autonomous Jailbreak Agents

大推理模型是自主的越狱代理

Thilo Hagendorff, Erik Derner, Nuria Oliver

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04294 2026-02-05 cs.CL cs.AI cs.CR 86%

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏