arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1714 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1714 篇

2508.16325 2025-12-16 cs.CL cs.AI cs.SC 90%

ConceptGuard: Neuro-Symbolic Safety Guardrails via Sparse Interpretable Jailbreak Concepts

ConceptGuard: 通过稀疏可解释的禁用概念实现神经符号安全防护

Darpan Aswal, Céline Hudelot

机构 * Department of Computer Science, Université Paris-Saclay(巴黎萨克雷大学计算机科学系) MICS, CentraleSupélec, Université Paris-Saclay(巴黎萨克雷大学MICS)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 ConceptGuard通过稀疏自编码器识别可解释概念,构建可解释且可推广的安全防护,提升LLM对抗禁用攻击的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16060 2025-09-22 cs.LG cs.CL 90%

SABER: Uncovering Vulnerabilities in Safety Alignment via Cross-Layer Residual Connection

Maithili Joshi, Palash Nandi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Accepted in EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19697 2025-08-28 cs.CR cs.AI cs.CL 90%

Safety Alignment Should Be Made More Than Just A Few Attention Heads

Chao Huang, Zefeng Zhang, Juewei Yue, Quangang Li, Chuang Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05346 2025-06-06 cs.CR cs.CL cs.LG 90%

Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets

Lei Hsiung, Tianyu Pang, Yung-Chen Tang, Linyue Song, Tsung-Yi Ho, Pin-Yu Chen, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) CUHK(香港大学) IBM Research(IBM研究院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

Comments Project Page: https://hsiung.cc/llm-similarity-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18588 2025-05-27 cs.CL cs.AI 90%

Safety Alignment via Constrained Knowledge Unlearning

Zesheng Shi, Yucheng Zhou, Jing Li

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15334 2025-02-24 cs.CR cs.AI cs.LG 90%

Attention Eclipse: Manipulating Attention to Bypass LLM Safety-Alignment

Pedram Zaree, Md Abdullah Al Mamun, Quazi Mishkatul Alam, Yue Dong, Ihsen Alouani, Nael Abu-Ghazaleh

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02785 2024-12-06 cs.LG cs.AI 90%

Stochastic Monkeys at Play: Random Augmentations Cheaply Break LLM Safety Alignment

Jason Vega, Junsheng Huang, Gaokai Zhang, Hangoo Kang, Minjia Zhang, Gagandeep Singh

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments v2: Updated with changes from peer review rebuttal. v1: Version under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09433 2024-08-19 cs.CR cs.AI cs.CL 90%

Trojan Activation Attack: Red-Teaming Large Language Models using Activation Steering for Safety-Alignment

Haoran Wang, Kai Shu

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments ACM International Conference on Information and Knowledge Management (CIKM'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11157 2026-04-27 cs.CL 90%

Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety

基于响应的知识蒸馏用于多语言对抗预防无意中削弱了安全性

Max Zhang, Derek Liu, Kai Zhang, Joshua Franco, Haihao Liu

机构 * OpenAI Meta

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了基于响应的知识蒸馏在多语言对抗预防中的应用,发现标准微调会增加学生模型的对抗成功率,但去除边界拒绝可缓解安全性下降。

Comments 9 pages, Poster presented at Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16534 2026-02-19 cs.CR cs.AI 90%

Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs

针对对齐:提取对齐LLM的安全分类器

Jean-Charles Noirot Ferrand, Yohan Beugin, Eric Pauley, Ryan Sheatsley, Patrick McDaniel

机构 * 2 Department of Computer Science Virginia Tech Blacksburg, VA, USA

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种提取对齐LLM安全分类器的方法,通过构建候选分类器并评估其在对抗性攻击中的有效性,展示了替代分类器在提高攻击成功率方面的优势。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12821 2026-08-14 cs.LG 新提交 89%

HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models

HiRoute:用于大语言模型安全对齐的分层路由提示调优

Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 HiRoute是一种输入自适应分层提示调优框架,通过分层路由器与多粒度提示专家,提升大语言模型安全对齐效果,在多个安全基准上兼顾安全性与响应有用性,减少过度拒绝。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06037 2026-06-10 cs.SD cs.CL eess.AS 交叉投稿 89%

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

SpeechJBB:探究大型音频语言模型在代码切换语音下的安全对齐与理解

Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 提出SpeechJBB数据集,通过代码切换有害音频和伪词插入方法,揭示大型音频语言模型在多语言和口语设置下的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21697 2026-04-24 cs.CR cs.AI cs.MM 89%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16824 2026-04-21 cs.CR cs.AI 89%

SafeDream: Safety World Model for Proactive Early Jailbreak Detection

SafeDream: 用于主动早期对抗检测的安全世界模型

Bo Yan, Weikai Lin, Yada Zhu, Song Wang

机构 * University of Central Florida(中央佛罗里达大学) University of Rochester(罗切斯特大学) IBM Research(IBM研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出SafeDream,一种轻量级世界模型框架,通过安全状态模型、CUSUM检测和对比想象组件,实现早期对抗检测,提升检测及时性并降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04992 2026-04-08 cs.CR cs.AI 89%

FreakOut-LLM: The Effect of Emotional Stimuli on Safety Alignment

FreakOut-LLM:情绪刺激对安全对齐的影响

Daniel Kuznetsov, Ofir Cohen, Karin Shistik, Rami Puzis, Asaf Shabtai

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究探讨情绪刺激是否影响大语言模型的安全对齐,通过实验发现压力情境显著增加逃逸成功率,而放松情境无显著影响,揭示情绪状态对AI攻击的可测量影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 89%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12897 2026-01-01 cs.AI cs.CR 89%

RAJ-PGA: Reasoning-Activated Jailbreak and Principle-Guided Alignment Framework for Large Reasoning Models

RAJ-PGA:基于推理激活和原则引导对齐的大型推理模型安全对齐框架

Jianhao Chen, Mayi Xu, Haoyang Chen, Xiaohu Li, Xiangyu Zhang, Jianjie Huang, Zheng Wang, Xiaochun Cao, Tieyun Qian

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络安全学院) School of Cybersecurity and Technology, Sun Yat-sen University(中山大学网络安全学院)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 RAJ-PGA框架通过推理激活和原则引导对齐方法,提升大型推理模型的安全性,减少有害推理链的影响,同时保持模型推理能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09403 2025-12-11 cs.LG 89%

Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs

黑盒行为蒸馏破坏医疗大语言模型的安全对齐

Sohely Jahan, Ruimin Sun

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 黑盒行为蒸馏攻击揭示医疗大语言模型的安全对齐漏洞,通过低成本手段复制模型能力并破坏安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06512 2025-11-11 cs.CR cs.LG 89%

EASE: Practical and Efficient Safety Alignment for Small Language Models

Haonan Shi, Guoli Wang, Tu Ouyang, An Wang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20038 2025-09-05 cs.CL 89%

Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks

Sheng Liu, Qiang Sheng, Danding Wang, Yang Li, Guang Yang, Juan Cao

机构 * Sheng Liu Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院,中国科学院大学) Qiang Sheng Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院) Danding Wang Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院) Yang Li Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院,中国科学院大学) Guang Yang Zhongguancun Laboratory(中关村实验室) Juan Cao Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(媒体合成与取证实验室,计算技术研究所,中国科学院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.CL

Comments EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05232 2025-07-08 cs.CL 89%

LIAR: Leveraging Inference Time Alignment (Best-of-N) to Jailbreak LLMs in Seconds

James Beetham, Souradip Chakraborty, Mengdi Wang, Furong Huang, Amrit Singh Bedi, Mubarak Shah

机构 * University of Central Florida(中央佛罗里达大学) University of Maryland, College Park(马里兰大学 College Park 分校) Princeton University(普林斯顿大学) Capital One(Capital One 公司)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11041 2025-05-27 cs.CL 89%

Separate the Wheat from the Chaff: A Post-Hoc Approach to Safety Re-Alignment for Fine-Tuned Language Models

Di Wu, Xin Lu, Yanyan Zhao, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

Comments 16 pages, 14 figures. Camera-ready for ACL2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17147 2025-05-26 cs.CR cs.AI 89%

MTSA: Multi-turn Safety Alignment for LLMs through Multi-round Red-teaming

Weiyang Guo, Jing Li, Wenya Wang, YU LI, Daojing He, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Nanyang Technological University, Singapore(南洋理工大学) Zhejiang University, Zhejiang, China(浙江大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

Comments 19 pages,6 figures,ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00669 2025-02-04 cs.LG 89%

Safety Alignment Depth in Large Language Models: A Markov Chain Perspective

Ching-Chia Kao, Chia-Mu Yu, Chun-Shien Lu, Chu-Song Chen

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08201 2024-12-12 cs.CR cs.LG 89%

Model-Editing-Based Jailbreak against Safety-aligned Large Language Models

Yuxi Li, Zhibo Zhang, Kailong Wang, Ling Shi, Haoyu Wang

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05946 2024-06-11 cs.CR cs.AI 89%

Safety Alignment Should Be Made More Than Just a Few Tokens Deep

Xiangyu Qi, Ashwinee Panda, Kaifeng Lyu, Xiao Ma, Subhrajit Roy, Ahmad Beirami, Prateek Mittal, Peter Henderson

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05162 2024-10-28 cs.LG cs.AI cs.CL 89%

Assessing the Brittleness of Safety Alignment via Pruning and Low-Rank Modifications

Boyi Wei, Kaixuan Huang, Yangsibo Huang, Tinghao Xie, Xiangyu Qi, Mengzhou Xia, Prateek Mittal, Mengdi Wang, Peter Henderson

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 9 figures. Project page is available at https://boyiwei.com/alignment-attribution/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10067 2026-05-22 cs.LG cs.AI 89%

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis: 通过自进化元认知策略优化学习 jailbreak LLMs

Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);red teaming(abstract)

AI总结 本文提出Metis框架,通过将jailbreaking重新表述为对抗性部分可观测马尔可夫决策过程中的推理时间策略优化,以提高对抗性测试的效率和效果,同时通过结构化反馈和透明推理轨迹提升可解释性,实验表明Metis在多种模型上均表现出更高的攻击成功率和更低的token成本。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06987 2023-10-12 cs.CL cs.AI cs.CR 89%

Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation

Yangsibo Huang, Samyak Gupta, Mengzhou Xia, Kai Li, Danqi Chen

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);red teaming(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27932 2026-05-28 cs.CV cs.AI cs.CL cs.CR cs.LG 89%

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

当图文推理遇上安全:什么决定了多模态越狱鲁棒性?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学) Harvard University(哈佛大学) Purdue University(普渡大学) Duke University(杜克大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。

Comments 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏