arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2602.19396 2026-02-24 cs.AI 70%

Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement

明文之中隐藏:通过激活解耦检测隐蔽的 jailbreak

Amirhossein Farzam, Majid Behabahani, Mani Malek, Yuriy Nevmyvaka, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind) Apple(苹果公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 通过解耦 LLM 激活中的语义因子,提出 FrameShield 异常检测器,提升对隐蔽 jailbreak 的检测能力,并推动 LLM 安全和可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15001 2026-02-19 cs.LG 70%

Boundary Point Jailbreaking of Black-Box LLMs

黑盒大语言模型的边界点劫持

Xander Davies, Giorgi Giglemiani, Edmund Lau, Eric Winsor, Geoffrey Irving, Yarin Gal

机构 * UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML、牛津大学)

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.LG

AI总结 BPJ是一种全新的黑盒自动化劫持攻击方法,通过边界点选择策略有效突破宪法分类器和GPT-5输入分类器的防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08862 2026-01-29 cs.LG cs.CR 70%

LLMStinger: Jailbreaking LLMs using RL fine-tuned LLMs

LLMStinger: 使用强化学习微调的LLM进行LLM劫持

Piyush Jha, Arnav Arora, Vijay Ganesh

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 LLMStinger通过强化学习微调LLM,生成对抗性后缀以提高对有害问题的攻击成功率,显著优于现有方法。

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 70%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20224 2026-01-15 cs.CL 70%

Can Editing LLMs Inject Harm?

能否通过编辑LLM注入危害?

Canyu Chen, Baixiang Huang, Zekun Li, Zhaorun Chen, Shiyang Lai, Xiongxiao Xu, Jia-Chen Gu, Jindong Gu, Huaxiu Yao, Chaowei Xiao, Xifeng Yan, William Yang Wang, Philip Torr, Dawn Song, Kai Shu

机构 * Northwestern University(西北大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出编辑攻击作为LLM安全威胁,揭示了通过编辑注入虚假信息和偏见的风险及高隐蔽性。

Comments Accepted to Proceedings of AAAI 2026. The first two authors contributed equally. 7 pages for main paper, 31 pages including appendix. The code, results, dataset for this paper and more resources are on the project website: https://llm-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07263 2026-01-13 cs.CR cs.AI 70%

When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent

当机器人上当:揭露和缓解网络自动化代理中新兴的社会工程攻击

Xinyi Wu, Geng Hong, Yueyue Chen, MingXuan Liu, Feier Jin, Xudong Pan, Jiarun Dai, Baojun Liu

机构 * Fudan University(复旦大学) Zhongguancun Laboratory(中关村实验室) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究提出AgentBait攻击范式,揭示网络自动化代理的社会工程威胁,并设计SUPERVISOR模块有效缓解此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05466 2026-01-12 cs.CR cs.AI 70%

Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning

通过强化学习的迭代工具伪装攻击对大型语言模型进行劫持

Zhaoqi Wang, Zijian Zhang, Daqing He, Pengtao Kou, Xin Li, Jiamou Liu, Jincheng An, Yong Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(信息科学与技术学院,北京理工大学) School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science, University of Auckland(计算机科学学院,奥克兰大学) QAX Security Center, Qi-AnXin Technology Group Inc.(QAX安全中心,启安新科技集团) Qi-AnXin Technology Group Inc.(启安新科技集团) Zhongguancun Laboratory(中关村实验室)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出iMIST方法,通过伪装工具调用和强化学习优化,提高对大型语言模型的攻击效果,揭示现有安全机制的漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 70%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR 70%

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01020 2025-12-25 cs.CR cs.LG 70%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:多轮对抗性提示生成用于大型语言模型的多轮 Jailbreaking 攻击

Aashray Reddy, Andrew Zagula, Nicholas Saban

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 AutoAdv 提出了一种自动化多轮对抗性提示生成方法,通过策略性重写和优化配置,实现对大型语言模型的安全机制的高效攻击,揭示了其在有害内容生成上的高成功率。

Comments We encountered issues with the paper being hosted under my personal account, so we republished it under a different account associated with a university email, which makes updates and management easier. As a result, this version is a duplicate of arXiv:2511.02376

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18244 2025-12-23 cs.CR cs.AI 70%

Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation

打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击

Zehao Liu, Xi Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13901 2025-12-23 cs.CL 70%

RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs

RAID:针对对抗解码的拒绝意识与集成解码用于对抗大型语言模型

Tuan T. Nguyen, John Le, Thai T. Vu, Willy Susilo, Heath Cooper

机构 * University of Wollongong(沃林根大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 RAID通过嵌入空间正则化和拒绝意识正则化器,有效提升对抗解码攻击的成功率,同时降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04841 2025-12-05 cs.CR cs.AI 70%

SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security

SoK:面向大语言模型安全的综合因果分析框架

Wei Zhao, Zhe Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出一个综合因果分析框架,用于研究大语言模型安全问题,通过系统分析因果因素提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22044 2025-12-01 cs.CR cs.AI 70%

Distillability of LLM Security Logic: Predicting Attack Success Rate of Outline Filling Attack via Ranking Regression

LLM安全逻辑的可蒸馏性:通过排序回归预测轮廓填充攻击的成功率

Tianyu Zhang, Zihang Xi, Jingyu Hua, Sheng Zhong

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文通过排序回归方法,研究LLM安全逻辑的可蒸馏性,提出改进的轮廓填充攻击以预测攻击成功率,实验表明代理模型在预测安全边界方面具有较高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17666 2025-11-25 cs.CR cs.AI 70%

Evaluating Adversarial Vulnerabilities in Modern Large Language Models

评估现代大语言模型中的对抗漏洞

Tom Perel

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文评估了现代大语言模型在对抗攻击中的安全漏洞,通过比较Gemini 2.5 Flash和GPT-4的易受性,揭示了安全机制的差异及Transformer架构的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16347 2025-11-21 cs.CR cs.CY cs.RO 70%

The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks

具身AI的肖申克救赎:理解与评估间接环境劫持

Chunyang Li, Zifeng Kang, Junwei Zhang, Zhuo Ma, Anda Cheng, Xinghua Li, Jianfeng Ma

机构 * Xidian University(西安电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Ant Group(蚂蚁集团)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 本文提出了一种新型的间接环境劫持攻击,通过环境注入的恶意提示劫持具身AI,并设计了自动攻击生成和基准评估框架,评估结果显示其在多个任务场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16278 2025-11-21 cs.CR cs.AI 70%

"To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios

为生存,我必须背叛:通过博弈论场景进行大语言模型的劫持攻击

Zhen Sun, Zongmin Zhang, Deqi Liang, Han Sun, Yule Liu, Yun Shen, Xiangshan Gao, Yilong Yang, Shuai Liu, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) East China Normal University(华东师范大学) Flexera(Flexera公司) Zhejiang University(浙江大学) Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学) Institute of Deep Perception Technology, JITRI(JITRI深度感知技术研究所)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出一种基于博弈论的可扩展黑盒劫持框架GTA,通过重塑LLM目标以提高攻击成功率,实现在多种场景下的高ASR表现。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01223 2025-11-18 cs.CR cs.CL 70%

Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge

Ning Xu, Bo Gao, Hui Dou

机构 * School of Computer Science and Technology(计算机科学与技术学院) AnHui University(安徽大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12782 2025-11-18 cs.CL cs.CR 70%

LLM Reinforcement in Context

Thomas Rivasseau

机构 * McGill University(麦吉尔大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17089 2025-11-18 cs.CL 70%

Chain-of-Thought Driven Adversarial Scenario Extrapolation for Robust Language Models

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Ye Wang, Gang Tan, Shagufta Mehnaz

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 19 pages, 5 figures. Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14536 2025-10-24 cs.CL 70%

Breaking Bad Tokens: Detoxification of LLMs Using Sparse Autoencoders

Agam Goyal, Vedant Rathi, William Yeh, Yian Wang, Yuen Chen, Hari Sundaram

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03417 2025-10-22 cs.CR cs.AI 70%

NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks

Javad Rafiei Asl, Sidhant Narula, Mohammad Ghasemigol, Eduardo Blanco, Daniel Takabi

机构 * Old Dominion University(旧 Dominion 大学) University of Arizona(亚利桑那大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

Comments This paper has been accepted in the main conference proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025). Javad Rafiei Asl and Sidhant Narula are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15068 2025-10-20 cs.CR cs.AI 70%

Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling

Deyue Zhang, Dongdong Yang, Junjie Mu, Quancheng Zou, Zonghao Ying, Wenzhuo Xu, Zhao Liu, Xuan Wang, Xiangzheng Zhang

机构 * AI Security Lab(360人工智能安全实验室) Politecnico di Milano(米兰理工大学) Beihang University(北京航空航天大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13190 2025-10-16 cs.CL 70%

SHIELD: Classifier-Guided Prompting for Robust and Safer LVLMs

Juan Ren, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09699 2025-10-14 cs.CR cs.AI 70%

VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands

Aofan Liu, Lulu Tang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09471 2025-10-13 cs.CL 70%

Getting Your Indices in a Row: Full-Text Search for LLM Training Data for Real World

Ines Altemir Marinas, Anastasiia Kucherenko, Alexander Sternfeld, Andrei Kucharavy

机构 * IC, EPFL(EPFL)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18564 2025-10-07 cs.CR cs.AI 70%

DualBreach: Efficient Dual-Jailbreaking via Target-Driven Initialization and Multi-Target Optimization

Xinzhe Huang, Kedong Xiu, Tianhang Zheng, Churui Zeng, Wangze Ni, Zhan Qin, Kui Ren, Chun Chen

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(区块链与数据安全国家重点实验室,浙江大学,杭州,中国) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, China(杭州高新技术区(滨江)区块链与数据安全研究院,杭州,中国)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23558 2025-09-30 cs.AI cs.CR 70%

Formalization Driven LLM Prompt Jailbreaking via Reinforcement Learning

Zhaoqi Wang, Daqing He, Zijian Zhang, Xin Li, Liehuang Zhu, Meng Li, Jiamou Liu

机构 * Beijing Institute of Technology(北京理工大学) Hefei University of Technology(合肥工业大学) The University of Auckland(奥克兰大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05652 2025-09-23 cs.CR cs.CL 70%

Sugar-Coated Poison: Benign Generation Unlocks LLM Jailbreaking

Yu-Hang Wu, Yu-Jie Xiong, Hao Zhang, Jia-Chen Zhang, Zheng Zhou

机构 * Shanghai University of Engineering Science(上海工程技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12724 2025-09-17 cs.CV cs.AI 70%

Defense-to-Attack: Bypassing Weak Defenses Enables Stronger Jailbreaks in Vision-Language Models

Yunhan Zhao, Xiang Zheng, Xingjun Ma

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏