arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2510.10281 2025-10-28 cs.CR cs.AI cs.CL cs.CV cs.LG 85%

ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test

Guan-Yan Yang, Tzu-Yu Cheng, Ya-Wen Teng, Farn Wanga, Kuo-Hui Yeh

机构 * Department of Electrical Engineering, National Taiwan University(国立台湾大学电子工程系) GARMIN (ASIA) CORPORATION(GARMIN(亚洲)公司) Institute of Artificial Intelligence Innovation, National Yang Ming Chiao Tung University(国家阳明交通大学人工智能创新研究所) Department of Information Management, National Dong Hwa University(国立东吴大学资讯管理系)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages, 22 figures. This preprint has been accepted for publication in Elsevier JOURNAL OF NETWORK AND COMPUTER APPLICATIONS (JNCA)

Journal ref Journal of Network and Computer Applications, Vol. 244, (2025) 104356

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06989 2025-08-29 cs.CR cs.CV 85%

Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application

Wenzhuo Xu, Zhipeng Wei, Xiongtao Sun, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21820 2025-07-30 cs.CV 85%

Anyone Can Jailbreak: Prompt-Based Attacks on LLMs and T2Is

Ahmed B Mustafa, Zihan Ye, Yang Lu, Michael P Pound, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Intelligent Science, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学智能科学系) School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15606 2025-07-29 cs.LG cs.AI cs.CL 85%

LoX: Low-Rank Extrapolation Robustifies LLM Safety Against Fine-tuning

Gabriel J. Perin, Runjin Chen, Xuxi Chen, Nina S. T. Hirata, Zhangyang Wang, Junyuan Hong

机构 * University of São Paulo(圣保罗大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12430 2025-07-14 cs.CR cs.CV 85%

Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025

Zonghao Ying, Siyang Wu, Run Hao, Peng Ying, Shixuan Sun, Pengyu Chen, Junze Chen, Hao Du, Kaiwen Shen, Shangkun Wu, Jiwei Wei, Shiyuan He, Yang Yang, Xiaohai Xu, Ke Ma, Qianqian Xu, Qingming Huang, Shi Lin, Xun Wang, Changting Lin, Meng Han, Yilei Jiang, Siqi Lai, Yaozhi Zheng, Yifei Song, Xiangyu Yue, Zonglei Jing, Tianyuan Zhang, Zhilei Zhu, Aishan Liu, Jiakai Wang, Siyuan Liang, Xianglong Kong, Hainan Li, Junjie Mu, Haotong Qin, Yue Yu, Lei Chen, Felix Juefei-Xu, Qing Guo, Xinyun Chen, Yew Soon Ong, Xianglong Liu, Dawn Song, Alan Yuille, Philip Torr, Dacheng Tao

机构 * Beihang University(北航) Zhongguancun Laboratory(中关村实验室) Hefei Comprehensive National Science Center(合肥综合性国家科学中心) ETH Zürich(苏黎世联邦理工学院) Pengcheng Laboratory(鹏城实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) University of Oxford(牛津大学) Meta Google Brain(谷歌脑) Nanyang Technological University(南洋理工大学) Aarhus University(哥本哈根大学) China University of Mining(中国矿业大学) University of Electronic Science(电子科学大学) School of Electronic, Electrical(电子、电气与通信工程学院) Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS(智能信息处理国家重点实验室) School of Computer Science(计算机科学学院) Key Laboratory of Big Data Mining(大数据挖掘国家重点实验室) Zhejiang Gongshang University(浙江工商大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

Comments AdvML@CVPR Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21972 2025-06-30 cs.CL cs.AI cs.CR cs.LG 85%

Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses

Mohamed Ahmed, Mohamed Abdelmouty, Mingyu Kim, Gunvanth Kandula, Alex Park, James C. Davis

机构 * Purdue University(普渡大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03788 2025-06-10 cs.CR cs.AI cs.CL cs.LG 85%

HSF: Defending against Jailbreak Attacks with Hidden State Filtering

Cheng Qian, Hainan Zhang, Lei Sha, Zhiming Zheng

机构 * School of AI, Beihang University(北京航空航天大学人工智能学院) Beijing Advanced Innovation Center(北京先进创新中心)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments WWW2025 WSAI BESTPAPER

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15806 2025-06-04 cs.CR cs.AI cs.CL cs.LG 85%

A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos

Yang Yao, Xuan Tong, Ruofan Wang, Yixu Wang, Lujundong Li, Liang Liu, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23839 2025-06-02 cs.CR q-bio.GN 85%

GeneBreaker: Jailbreak Attacks against DNA Language Models with Pathogenicity Guidance

Zaixi Zhang, Zhenghong Zhou, Ruofan Jin, Le Cong, Mengdi Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15753 2025-05-22 cs.CR cs.AI cs.CL cs.LG 85%

Scalable Defense against In-the-wild Jailbreaking Attacks with Safety Context Retrieval

Taiye Chen, Zeming Wei, Ang Li, Yisen Wang

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Mathematical Sciences, Peking University(数学系,北京大学) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,智能科学与技术学校,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13052 2025-04-18 cs.CR 85%

GraphAttack: Exploiting Representational Blindspots in LLM Safety Mechanisms

Sinan He, An Wang

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07557 2025-02-12 cs.CR 85%

JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation

Shenyi Zhang, Yuchen Zhai, Keyan Guo, Hongxin Hu, Shengnan Guo, Zheng Fang, Lingchen Zhao, Chao Shen, Cong Wang, Qian Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

Comments To Appear in the 34rd USENIX Security Symposium, August 13-15, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00653 2025-02-04 cs.CR 85%

Towards Robust Multimodal Large Language Models Against Jailbreak Attacks

Ziyi Yin, Yuanpu Cao, Han Liu, Ting Wang, Jinghui Chen, Fenhlong Ma

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02018 2025-01-07 cs.CL cs.AI cs.CR cs.LG 85%

Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs

Joao Fonseca, Andrew Bell, Julia Stoyanovich

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02159 2024-12-04 cs.LG cs.AI cs.CL cs.CR 85%

Jailbreak Defense in a Narrow Domain: Limitations of Existing Methods and a New Transcript-Classifier Approach

Tony T. Wang, John Hughes, Henry Sleight, Rylan Schaeffer, Rajashree Agrawal, Fazl Barez, Mrinank Sharma, Jesse Mu, Nir Shavit, Ethan Perez

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the AdvML-Frontiers and SoLaR workshops at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10862 2024-11-01 cs.LG cs.AI cs.CL cs.CR 85%

Pruning for Protection: Increasing Jailbreak Resistance in Aligned LLMs Without Fine-Tuning

Adib Hasan, Ileana Rugina, Alex Wang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Proceedings of the 7th BlackboxNLP Workshop: Analyzing and Interpreting Neural Networks for NLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08464 2024-10-23 cs.CR 85%

$\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models

Fenghua Weng, Yue Xu, Chengyan Fu, Wenjie Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09572 2024-10-16 cs.CV 85%

Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Hang Xu, Zhenguo Li, Dit-Yan Yeung, James T. Kwok, Yu Zhang

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

Comments ECCV2024 (Project Page: https://gyhdog99.github.io/projects/ecso/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09289 2024-10-08 cs.CL cs.AI cs.LG 85%

Understanding Jailbreak Success: A Study of Latent Space Dynamics in Large Language Models

Sarah Ball, Frauke Kreuter, Nina Panickssery

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 37 pages, added analyses for 3 more models

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14461 2024-06-07 cs.CL cs.AI cs.CR cs.LG 85%

Competition Report: Finding Universal Jailbreak Backdoors in Aligned LLMs

Javier Rando, Francesco Croce, Kryštof Mitka, Stepan Shabalin, Maksym Andriushchenko, Nicolas Flammarion, Florian Tramèr

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Competition Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06387 2024-05-28 cs.LG cs.AI cs.CL cs.CR 85%

Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations

Zeming Wei, Yifei Wang, Ang Li, Yichuan Mo, Yisen Wang

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14455 2024-04-30 cs.AI cs.CL cs.CR cs.LG 85%

Universal Jailbreak Backdoors from Poisoned Human Feedback

Javier Rando, Florian Tramèr

专题命中 越狱攻击 :jailbreak(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as conference paper in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02446 2024-01-30 cs.CL cs.AI cs.CR cs.LG 85%

Low-Resource Languages Jailbreak GPT-4

Zheng-Xin Yong, Cristina Menghini, Stephen H. Bach

专题命中 越狱攻击 :jailbreak(title);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS Workshop on Socially Responsible Language Modelling Research (SoLaR) 2023. Best Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18638 2025-11-14 cs.CR cs.AI cs.CL 84%

Graph of Attacks with Pruning: Optimizing Stealthy Jailbreak Prompt Generation for Enhanced LLM Content Moderation

Daniel Schwartz, Dmitriy Bespalov, Zhe Wang, Ninad Kulkarni, Yanjun Qi

机构 * Amazon Bedrock Science(亚马逊Bedrock科学) Drexel University(德雷塞尔大学) University of Virginia(弗吉尼亚大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract,comments);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures; published in EMNLP 2025 ; Code at: https://github.com/dsbuddy/GAP-LLM-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17739 2025-09-30 cs.LG cs.AI 84%

Speculative Safety-Aware Decoding

Xuekang Wang, Shengyu Zhu, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments Camera-ready version of EMNLP 2025 main conference. Code: https://github.com/k-k1w-w1x-x/Speculative-Safety-Aware-Decoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02151 2025-04-21 cs.CR cs.AI cs.LG stat.ML 84%

Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks

Maksym Andriushchenko, Francesco Croce, Nicolas Flammarion

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2025. Updates in the v3: GPT-4o and Claude 3.5 Sonnet results, improved writing. Updates in the v2: more models (Llama3, Phi-3, Nemotron-4-340B), jailbreak artifacts for all attacks are available, evaluation with different judges (Llama-3-70B and Llama Guard 2), more experiments (convergence plots, ablation on the suffix length for random search), examples of jailbroken generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20971 2025-02-13 cs.CV cs.AI cs.LG 84%

BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks

Yunhan Zhao, Xiang Zheng, Lin Luo, Yige Li, Xingjun Ma, Yu-Gang Jiang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI、cs.LG

Journal ref ICLR 2025, BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks. In Proceedings of the International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00236 2026-05-04 cs.CR cs.AI 84%

Attention Is Where You Attack

注意力是攻击之处

Aviral Srivastava, Sourav Panda

机构 * Amazon(亚马逊) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出注意力重分布攻击(ARA),通过Gumbel-softmax优化在概率单纯形上攻击softmax注意力,成功绕过安全对齐,实现高准确率的恶意请求执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17053 2026-04-21 cs.CL 84%

Jailbreaking Large Language Models with Morality Attacks

通过道德攻击 jailbreak 大型语言模型

Ying Su, Mingen Zheng, Weili Diao, Haoran Li

机构 * South China University of Technology(南方科技大学) HKUST(香港科技大学) Beihang University(北航大学)

专题命中 越狱攻击 :jailbreak(title_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 本文通过道德攻击研究大型语言模型的内部道德价值观,构建了包含10300个实例的道德数据集,提出了四种对抗攻击方法,揭示了LLM和防护模型在道德感知攻击中的关键漏洞。

Comments 27 pages, 6 figures, 18 tables. Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06110 2026-08-12 cs.AI cs.CL 版本更新 84%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏