arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1714 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1714 篇

2605.08513 2026-05-12 cs.CL cs.AI cs.LG 89%

A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models

单个神经元足以绕过大型语言模型的安全对齐

Hamid Kazemi, Atoosa Chegini, Maria Safi

机构 * Apple(苹果公司) University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过针对单个神经元展示安全对齐的两种失效方向,证明在不训练或提示工程的情况下,通过抑制或放大特定神经元可绕过安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12710 2026-04-24 cs.LG cs.AI cs.CL 89%

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性

Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17093 2026-04-21 cs.CR 89%

HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking

HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全

Zeng Wang, Minghao Shao, Weimin Fu, Prithwish Basu Roy, Xiaolong Guo, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract)

AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16659 2026-04-21 cs.CR cs.SD 89%

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs

良性微调破坏音频大语言模型的安全对齐

Jaechul Roh, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract,abstract_cn)

AI总结 研究探讨了音频大语言模型中良性微调对安全对齐的影响,发现通过嵌入空间距离筛选良性音频可降低安全风险,但不同架构和模态的微调风险存在差异,提出两种防御措施以降低安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17072 2025-06-02 cs.CR cs.AI cs.CL cs.LG 89%

Safety Alignment Can Be Not Superficial With Explicit Safety Signals

Jianwei Li, Jung-Eun Kim

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01703 2025-02-03 cs.CL cs.AI cs.LG 89%

UniGuard: Towards Universal Safety Guardrails for Jailbreak Attacks on Multimodal Large Language Models

Sejoon Oh, Yiqiao Jin, Megha Sharma, Donghyun Kim, Eric Ma, Gaurav Verma, Srijan Kumar

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06302 2024-07-04 cs.CR cs.CV 89%

Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks

Zonghao Ying, Aishan Liu, Xianglong Liu, Dacheng Tao

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06854 2026-08-14 cs.CL 版本更新 89%

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA: 简单却有效的多轮对抗攻击学习

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

专题命中 越狱攻击 :jailbreak(title,abstract);DPO(abstract,abstract_cn);alignment(abstract);safety(abstract)

AI总结 SEMA通过多阶段学习实现高效多轮对抗攻击,无需依赖现有策略,提升攻击成功率并增强安全测试能力。

Comments ICLR 2026, 37 pages, 13 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12710 2026-05-19 cs.CL cs.CR 89%

Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs

改进方法而非提示:针对大语言模型的进化式 jailbreak 攻击合成

Yunhao Chen, Xin Wang, Juncheng Li, Yixu Wang, Jie Li, Yan Teng, Yingchun Wang, Xingjun Ma

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 越狱攻击 :jailbreak(title,title_cn);red teaming(abstract);分类 cs.CL

AI总结 本文提出 EvoSynth 框架,通过在代码空间中进行搜索,而非仅在提示空间中优化,从而提高对大语言模型的 jailbreak 攻击成功率和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11002 2026-05-13 cs.CR cs.AI 89%

MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

MT-JailBench: 一个多模块的多轮 jailbreak 攻击评估基准

Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

机构 * International Computer Science Institute(国际计算机科学研究所) Berkeley Lab(伯克利实验室)

专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI

AI总结 本文提出 MT-JailBench,一个用于评估多轮 jailbreak 攻击的模块化框架,揭示了资源预算和评估函数对攻击效果的影响,发现提示生成是性能变化的主要因素,而动态策略生成并非必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-04-15 cs.AI cs.MM 89%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13068 2026-04-21 cs.CR cs.AI cs.LG 88%

Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment

揭示LLM安全对齐中的logit抑制漏洞

Yuxi Li, Yi Liu, Yuekang Li, Ling Shi, Gelei Deng, Shengquan Chen, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Nankai University(南开大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SSAG方法,通过系统操控输出层logit揭示LLM安全对齐的漏洞,实验显示其在五种主流模型上以95%成功率暴露有害响应,同时减少86%的响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28013 2026-04-13 cs.CR cs.AI cs.LG 88%

Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers

Kill-Chain Canaries: 阶段级跟踪跨攻击表面和模型安全层级的提示注入

Haochuan Kevin Wang, Zechen Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Chicago(芝加哥大学)

专题命中 越狱攻击 :safety(title,abstract);prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过跟踪加密令牌四个阶段,揭示提示注入是管道-架构问题,发现写节点位置是最高安全决策,所有防御因通道不匹配失效,且隐形白字体PDF负载可匹配或超越可见文本ASR。

Comments 10 pages, 8 figures. Benchmark code and run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18292 2026-02-02 cs.LG cs.AI 88%

TriPlay-RL: Tri-Role Self-Play Reinforcement Learning for LLM Safety Alignment

TriPlay-RL:三角色自我对抗强化学习用于大语言模型安全对齐

Zhewen Tan, Wenhan Yu, Jianfeng Si, Tongxin Liu, Kaiqi Guan, Huiyan Jin, Jiawen Tao, Xiaokun Yuan, Duohe Ma, Xiangzheng Zhang, Tong Yang, Lin Sun

机构 * Peking University(北京大学) Qiyuan Tech(启元科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 TriPlay-RL通过三角色自我对抗强化学习,实现LLM安全对齐的高效且可扩展范式,提升攻击有效性、安全性能和评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19487 2026-01-28 cs.LG cs.AI 88%

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

LLM-VA: 通过向量对齐解决对抗性回应与过度拒绝的权衡

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 LLM-VA通过向量对齐解决大型语言模型在对抗性回应与过度拒绝间的权衡问题,提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10150 2025-12-12 cs.CL cs.AI 88%

Unforgotten Safety: Preserving Safety Alignment of Large Language Models with Continual Learning

遗忘的安全性:通过持续学习保持大型语言模型的安全对齐

Lama Alssum, Hani Itani, Hasan Abed Al Kader Hammoud, Philip Torr, Adel Bibi, Bernard Ghanem

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过持续学习方法有效缓解大型语言模型在适应新任务时的安全退化问题,证明了持续学习在保持模型安全性和任务实用性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06852 2025-11-25 cs.CR cs.AI cs.LG cs.SE 88%

Differentiated Directional Intervention A Framework for Evading LLM Safety Alignment

差异化方向干预:一种规避LLM安全对齐的框架

Peng Zhang, Peijie Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DBDI框架,通过区分有害检测和拒绝执行方向,提升LLM安全对齐的规避效果。

Comments AAAI-26-AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20333 2025-07-29 cs.AI cs.LG stat.ML 88%

The Blessing and Curse of Dimensionality in Safety Alignment

Rachel S. Y. Teo, Laziz U. Abdullaev, Tan M. Nguyen

机构 * Department of Mathematics National University of Singapore(数学系新加坡国立大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11168 2025-07-15 cs.CR cs.AI cs.LG 88%

Bypassing LLM Guardrails: An Empirical Analysis of Evasion Attacks against Prompt Injection and Jailbreak Detection Systems

William Hackett, Lewis Birch, Stefan Trawicki, Neeraj Suri, Peter Garraghan

机构 * Mindgard Lancaster University(兰卡斯特大学)

专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(title,abstract);分类 cs.AI、cs.LG

Comments 14 pages, 5 figures, 11 tables. To be published in LLMSec 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08020 2025-07-14 cs.CL cs.AI 88%

Circumventing Safety Alignment in Large Language Models Through Embedding Space Toxicity Attenuation

Zhibo Zhang, Yuxi Li, Kailong Wang, Shuai Yuan, Ling Shi, Haoyu Wang

机构 * Huazhong University of Science and Technology(华中科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08983 2024-07-29 cs.CR cs.AI cs.CL 88%

SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding

Zhangchen Xu, Fengqing Jiang, Luyao Niu, Jinyuan Jia, Bill Yuchen Lin, Radha Poovendran

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI

Comments To appear in ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13453 2026-07-16 cs.CR cs.AI 新提交 88%

Adversarial Prompting Framework for AI Safety Assessment

用于人工智能安全评估的对抗性提示框架

Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee

机构 * Microsoft(微软)

专题命中 越狱攻击 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。

Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12681 2026-03-31 cs.CR cs.LG 88%

Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment

协同LoRA:大语言模型安全对齐中的组合性漏洞

Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。

Comments Updated manuscript to better reflect the core contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05772 2026-03-16 cs.CR cs.AI 88%

Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads

深度安全攻击:从深度安全注意力头中劫持大语言模型

Jinman Wu, Yi Xie, Shiqian Zhao, Xiaofeng Chen

专题命中 越狱攻击 :jailbreak(title,abstract);safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10091 2026-03-12 cs.CR cs.AI 88%

Multi-Stream Perturbation Attack: Breaking Safety Alignment of Thinking LLMs Through Concurrent Task Interference

多流扰动攻击:通过并发任务干扰破坏思考LLM的安全对齐

Fan Yang

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI

AI总结 多流扰动攻击通过并发任务干扰破坏思考LLM的安全对齐,实现高攻击成功率和推理过程崩溃

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22242 2026-02-27 cs.CR cs.AI 88%

Analysis of LLMs Against Prompt Injection and Jailbreak Attacks

对LLMs对抗提示注入和 jailbreak攻击的分析

Piyush Jaiswal, Aaditya Pratap, Shreyansh Saraswati, Harsh Kasyap, Somanath Tripathy

机构 * Bishop Cotton Boys’ School(伯希特·康普顿男校)

专题命中 越狱攻击 :jailbreak(title,abstract);prompt injection(title);safety(abstract);分类 cs.AI

AI总结 本文研究了LLMs对提示注入和jailbreak攻击的脆弱性,通过实验分析不同模型的行为差异,并评估了轻量级防御机制的效果。

Comments 12 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13547 2026-02-17 cs.CR cs.AI 88%

AISA: Awakening Intrinsic Safety Awareness in Large Language Models against Jailbreak Attacks

AISA: 在大型语言模型中唤醒对抗劫持攻击的内在安全性意识

Weiming Song, Xuan Xie, Ruiping Yin

机构 * Beijing University of Technology(北京理工大学) Macau University of Science and Technology(澳门科技大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.AI

AI总结 AISA通过激活模型内在安全机制,提供一种轻量级、单次通过的防御方法,有效提升大型语言模型对抗劫持攻击的鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19218 2025-11-27 cs.CR cs.AI 88%

Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization

对抗攻击-防御共演进用于LLM安全对齐的树组双感知搜索与优化

Xurui Li, Kaisong Song, Rui Zhu, Pin-Yu Chen, Haixu Tang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学) IBM Research AI(IBM人工智能研究) Indiana University(印第安纳大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(abstract);分类 cs.AI

AI总结 ACE-Safety通过树组双感知搜索与优化,共同优化攻击与防御模型,提升LLM的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09880 2025-11-14 cs.CL cs.CR 88%

EnchTable: Unified Safety Alignment Transfer in Fine-tuned Large Language Models

Jialin Wu, Kecen Li, Zhicong Huang, Xinfeng Li, Xiaofeng Wang, Cheng Hong

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

Comments Accepted by IEEE Symposium on Security and Privacy (S&P) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06338 2025-09-09 cs.CR cs.LG 88%

Embedding Poisoning: Bypassing Safety Alignment via Embedding Semantic Shift

Shuai Yuan, Zhibo Zhang, Yuxi Li, Guangdong Bai, Wang Kailong

机构 * University of Electronic Science and Technology of China(电子科技大学) Huazhong University of Science and Technology(华中科技大学) The University of Queensland(昆士兰大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.LG

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏