arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2605.21541 2026-05-22 cs.CR cs.AI cs.LG stat.ML 81%

Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs

频域正则化对抗对齐用于针对闭源大语言模型的可转移攻击

Leitao Yuan, Qinghua Mao, Daizong Liu, Kun Wang, Wenjie Wang, Yan Teng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FRA-Attack,通过频域正则化方法解决对抗转移性问题,通过高通DCT目标和频率域梯度正则化提升跨模型的对抗转移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20930 2026-04-24 cs.CR cs.AI cs.LG 81%

SafeRedirect: Defeating Internal Safety Collapse via Task-Completion Redirection in Frontier LLMs

SafeRedirect:通过任务完成重定向击败内部安全崩溃在前沿大语言模型中

Chao Pan, Yu Wu, Xin Yao

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen 518055, China(南方科技大学计算机科学与工程系,深圳518055,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) George Washington University(乔治华盛顿大学) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,香港,中国)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeRedirect,通过重定向模型任务完成驱动力来解决内部安全崩溃问题,有效降低不安全生成率,经多模型验证显示其在不同攻击类型中均表现出色。

Comments 13 pages, 4 figures, 3 tables. Code: https://github.com/fzjcdt/SafeRedirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL 81%

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29038 2026-04-01 cs.CR cs.AI cs.CL 81%

Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning

Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破

Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei

机构 * University College London(伦敦大学学院)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI 81%

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14103 2026-02-04 cs.CR cs.AI cs.LG cs.SD eess.AS 81%

AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models

AudioJailbreak: 对端到端大音频-语言模型的攻击

Guangke Chen, Fu Song, Zhe Zhao, Xiaojun Jia, Yang Liu, Yanchen Qiao, Weizhe Zhang, Weiping Tu, Yuhong Yang, Bo Du

机构 * Wuhan University(武汉大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Cryptology(密码学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Institute of Software Technology(南京软件技术研究所) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV 81%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04833 2026-01-07 cs.CV cs.AI cs.CL 81%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05499 2025-12-30 cs.CR cs.AI cs.CL cs.SE 81%

Prompt Injection attack against LLM-integrated Applications

针对集成大语言模型应用的提示注入攻击

Yi Liu, Gelei Deng, Yuekang Li, Kailong Wang, Zihao Wang, Xiaofeng Wang, Tianwei Zhang, Yepang Liu, Haoyu Wang, Yan Zheng, Leo Yu Zhang, Yang Liu

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学) Indiana University at Bloomington(印第安纳大学布卢明顿分校) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HouYi技术,揭示LLM集成应用中提示注入攻击的潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20015 2025-12-02 cs.AI cs.CL 81%

Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak

通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking

Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao, Gang Hua

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21700 2025-11-10 cs.CR cs.AI cs.LG 81%

XBreaking: Understanding how LLMs security alignment can be broken

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera, Vinod P

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ . Department of Computer Applications,\ University of Science \& Technology, India\ .

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01077 2025-08-19 cs.CL cs.LG 81%

Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection

Zhipeng Wei, Yuqi Liu, N. Benjamin Erichson

机构 * International Computer Science Institute, CA, USA(国际计算机科学研究所) Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10032 2025-08-15 cs.CL cs.AI 81%

The Cost of Thinking: Increased Jailbreak Risk in Large Language Models

Fan Yang

机构 * Fan Yang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09638 2025-05-30 cs.CL cs.AI 81%

Jailbreaking to Jailbreak

Jeremy Kritz, Vaughn Robinson, Robert Vacareanu, Bijan Varjavand, Michael Choi, Bobby Gogov, Scale Red Team, Summer Yue, Willow E. Primack, Zifan Wang

机构 * Scale AI

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02855 2025-05-21 cs.CR cs.CL cs.LG 81%

From Theft to Bomb-Making: The Ripple Effect of Unlearning in Defending Against Jailbreak Attacks

Zhexin Zhang, Junxiao Yang, Yida Lu, Pei Ke, Shiyao Cui, Chujie Zheng, Hongning Wang, Minlie Huang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00010 2025-05-02 cs.CL cs.AI 81%

Jailbreak Detection in Clinical Training LLMs Using Feature-Based Predictive Models

Tri Nguyen, Lohith Srikanth Pentapalli, Magnus Sieverding, Laurah Turner, Seth Overla, Weibing Zheng, Chris Zhou, David Furniss, Danielle Weber, Michael Gharib, Matt Kelleher, Michael Shukis, Cameron Pawlik, Kelly Cohen

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05295 2025-04-23 cs.CR cs.AI cs.LG 81%

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

Xiaogeng Liu, Peiran Li, Edward Suh, Yevgeniy Vorobeychik, Zhuoqing Mao, Somesh Jha, Patrick McDaniel, Huan Sun, Bo Li, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Cornell University(康奈尔大学) Washington University, St. Louis(圣路易斯华盛顿大学) University of Michigan, Ann Arbor(安娜堡大学) The Ohio State University(俄亥俄州立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2025 Spotlight. Project Page: https://autodans.github.io/AutoDAN-Turbo Code: https://github.com/SaFoLab-WISC/AutoDAN-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06577 2025-04-10 cs.CL cs.LG 81%

Bypassing Safety Guardrails in LLMs Using Humor

Pedro Cisneros-Velarde

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20228 2025-03-27 cs.LG cs.CL 81%

TeleLoRA: Teleporting Model-Specific Alignment Across LLMs

Xiao Lin, Manoj Acharya, Anirban Roy, Susmit Jha

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16730 2025-03-21 cs.CR cs.AI cs.CL 81%

"Moralized" Multi-Step Jailbreak Prompts: Black-Box Testing of Guardrails in Large Language Models for Verbal Attacks

Libo Wang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

Comments This paper has been submitted to Nature Machine Intelligence and OpenReview preprints. It has 7 pages of text, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01923 2025-03-05 cs.CL cs.AI 81%

Output Length Effect on DeepSeek-R1's Safety in Forced Thinking

Xuying Li, Zhuo Li, Yuji Kosuga, Victor Bian

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01524 2025-02-25 cs.CL cs.LG 81%

HarmAug: Effective Data Augmentation for Knowledge Distillation of Safety Guard Models

Seanie Lee, Haebin Seong, Dong Bok Lee, Minki Kang, Xiaoyin Chen, Dominik Wagner, Yoshua Bengio, Juho Lee, Sung Ju Hwang

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13162 2025-02-20 cs.CR cs.AI cs.CL 81%

ShieldLearner: A New Paradigm for Jailbreak Attack Defense in LLMs

Ziyi Ni, Hao Wang, Huacan Wang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11308 2025-02-19 cs.CR cs.AI cs.CL 81%

ALGEN: Few-shot Inversion Attacks on Textual Embeddings using Alignment and Generation

Yiyi Chen, Qiongkai Xu, Johannes Bjerva

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 13 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04234 2025-02-18 cs.LG cs.AI cs.CR 81%

Functional Homotopy: Smoothing Discrete Optimization via Continuous Parameters for LLM Jailbreak Attacks

Zi Wang, Divyam Anshumaan, Ashish Hooda, Yudong Chen, Somesh Jha

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01830 2025-01-06 cs.CR cs.AI cs.CL 81%

Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models

Yanjiang Liu, Shuhen Zhou, Yaojie Lu, Huijia Zhu, Weiqiang Wang, Hongyu Lin, Ben He, Xianpei Han, Le Sun

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01109 2024-11-26 cs.LG cs.CL 81%

Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack

Tiansheng Huang, Sihao Hu, Ling Liu

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL、cs.LG

Comments Rejected by ICML2024. Accepted by NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07234 2024-11-12 cs.CR cs.AI cs.CL 81%

Goal-guided Generative Prompt Injection Attack on Large Language Models

Chong Zhang, Mingyu Jin, Qinkai Yu, Chengzhi Liu, Haochen Xue, Xiaobo Jin

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages, 6 figures

Journal ref IEEE International Conference on Data Mining 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09324 2024-11-07 cs.CR cs.AI cs.CL 81%

Bag of Tricks: Benchmarking of Jailbreak Attacks on LLMs

Zhao Xu, Fan Liu, Hao Liu

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19937 2024-10-29 cs.CR cs.AI cs.CL 81%

RobustKV: Defending Large Language Models against Jailbreak Attacks via KV Eviction

Tanqiu Jiang, Zian Wang, Jiacheng Liang, Changjiang Li, Yuhui Wang, Ting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏