arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 75%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 75%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03771 2025-12-05 cs.CL cs.AI cs.CR cs.LG 75%

In-Context Representation Hijacking

上下文表示劫持

Itay Yona, Amir Sarid, Michael Karasik, Yossi Gandelsman

机构 * Mentaleap Independent Researcher(独立研究者) UC Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Doublespeak通过替换有害关键词为无害标记,使模型内部表示收敛至有害语义,从而绕过安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08367 2025-11-12 cs.CR 75%

Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs

Yuxuan Zhou, Yuzhao Peng, Yang Bai, Kuofeng Gao, Yihao Zhang, Yechao Zhang, Xun Chen, Tao Yu, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04707 2025-11-10 cs.CR cs.AI cs.CL cs.LG 75%

Jailbreaking in the Haystack

Rishi Rajesh Shah, Chen Henry Wu, Shashwat Saxena, Ziqian Zhong, Alexander Robey, Aditi Raghunathan

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08604 2025-10-31 cs.CL cs.AI cs.LG 75%

LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback

Raffaele Mura, Giorgio Piras, Kamilė Lukošiūtė, Maura Pintor, Amin Karbasi, Battista Biggio

机构 * University of Cagliari(卡利亚里大学) Centre for AI Governance(人工智能治理中心) Foundation AI – Cisco Systems Inc.(AI基金会——思科系统公司)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20223 2025-10-24 cs.CR cs.MM 75%

Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations

Divyanshu Kumar, Shreyas Jena, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 越狱攻击 :alignment(abstract);safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21401 2025-10-24 cs.CV 75%

JaiLIP: Jailbreaking Vision-Language Models via Loss Guided Image Perturbation

Md Jueal Mia, M. Hadi Amini

机构 * Knight Foundation School of Computing and Information Sciences (KFSCIS)(骑士基金会计算与信息科学学院) Florida International University(佛罗里达国际大学) Sustainability, Optimization, and Learning for InterDependent networks laboratory (solid lab)(可持续性、优化与互依赖网络学习实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01644 2025-10-13 cs.CL cs.AI cs.CY 75%

Machine Learning for Detection and Analysis of Novel LLM Jailbreaks

John Hawkins, Aditya Pramar, Rodney Beard, Rohitash Chandra

机构 * Centre for Artificial Intelligence and Innovation(人工智能与创新中心) Pingla Institute(平拉研究所) Transitional Artificial Intelligence Research Group(过渡人工智能研究组) UNSW(新南威尔士大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12221 2025-09-17 cs.LG cs.AI cs.CL cs.CR 75%

MEUV: Achieving Fine-Grained Capability Activation in Large Language Models via Mutually Exclusive Unlock Vectors

Xin Tong, Zhi Lin, Jingya Wang, Meng Han, Bo Jin

机构 * Xin Tong School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Zhi Lin School of Safety Science Tsinghua University(安全科学学院 清华大学) Jingya Wang School of Information and Cyber Security People’s Public Security University of China(信息与网络安全学院 中国人民公安大学) Meng Han Intelligent Fusion Research Center Zhejiang University(智能融合研究中心 浙江大学) Bo Jin* The Third Research Institute of the Ministry of Public Security of China(中华人民共和国公安部第三研究所)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10807 2025-06-13 cs.CR 75%

Towards Action Hijacking of Large Language Model-based Agent

Yuyang Zhang, Kangjie Chen, Jiaxin Gao, Ronghao Cui, Run Wang, Lina Wang, Tianwei Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02174 2025-06-09 cs.CL cs.AI cs.LG 75%

Adversarial Tokenization

Renato Lui Geh, Zilei Shao, Guy Van den Broeck

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20823 2025-03-28 cs.CR 75%

Playing the Fool: Jailbreaking LLMs and Multimodal LLMs with Out-of-Distribution Strategy

Joonhyun Jeong, Seyun Bae, Yeonsung Jung, Jaeryong Hwang, Eunho Yang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

Comments Accepted at CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18000 2024-12-02 cs.CV 75%

Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models

Shuyang Hao, Bryan Hooi, Jun Liu, Kai-Wei Chang, Zi Huang, Yujun Cai

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11445 2024-11-06 cs.CR cs.AI cs.CL cs.LG 75%

Jailbreaking Large Language Models with Symbolic Mathematics

Emet Bethany, Mazal Bethany, Juan Arturo Nolazco Flores, Sumit Kumar Jha, Peyman Najafirad

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19160 2024-10-28 cs.LG cs.AI cs.CL cs.CR 75%

Adversarial Attacks on Large Language Models Using Regularized Relaxation

Samuel Jacob Chacko, Sajib Biswas, Chashi Mahiul Islam, Fatema Tabassum Liza, Xiuwen Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01420 2024-08-05 cs.LG cs.AI cs.CL 75%

Mission Impossible: A Statistical Perspective on Jailbreaking LLMs

Jingtong Su, Julia Kempe, Karen Ullrich

专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07403 2024-07-15 cs.CV 75%

A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends

Daizong Liu, Mingyu Yang, Xiaoye Qu, Pan Zhou, Yu Cheng, Wei Hu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08679 2024-06-10 cs.LG cs.AI cs.CL 75%

COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability

Xingang Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, Bin Hu

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23075 2026-06-23 cs.CR cs.AI 新提交 74%

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

自进化LLM智能体系统中的安全性:威胁、放大与案例研究

Ruixiao Lin, Xinhao Deng, Qingming Li, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhenyuan Li, Yechao Zhang, Shiwen Cui, Changhua Meng, Tianwei Zhang, Xingjun Ma, Qi Li, Ke Xu, Shouling Ji

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

专题命中 越狱攻击 :safety(title);分类 cs.AI

AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21077 2026-06-23 cs.CR cs.CL 新提交 74%

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER:一种用于规避毒性检测的越狱提示优化的红队系统

Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

机构 * National Chengchi University, Taipei, Taiwan(国立中正大学,台北,台湾) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

AI总结 提出OTTER系统,通过替换少量令牌解耦表面毒性与对抗意图,在四个GPT模型上将平均攻击成功率从7.0%提升至84.0%,并首次量化分析毒性-绕过关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05379 2025-10-09 cs.CR cs.AI 74%

AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling

Xiaogeng Liu, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 越狱攻击 :jailbreak(title);分类 cs.AI

Comments Technical report. Code is available at https://github.com/SaFoLab-WISC/AutoDAN-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13662 2025-01-29 cs.CL 74%

Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings

Yue Huang, Jingyu Tang, Dongping Chen, Bingda Tang, Yao Wan, Lichao Sun, Philip S. Yu, Xiangliang Zhang

专题命中 越狱攻击 :alignment(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07725 2024-10-11 cs.LG cs.NE 74%

Towards Trustworthy Web Attack Detection: An Uncertainty-Aware Ensemble Deep Kernel Learning Model

Yonghang Zhou, Hongyi Zhu, Yidong Chai, Yuanchun Jiang, Yezheng Liu

专题命中 越狱攻击 :trustworthy(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16727 2024-09-26 cs.CL 74%

RoleBreak: Character Hallucination as a Jailbreak Attack in Role-Playing Systems

Yihong Tang, Bo Wang, Xu Wang, Dongming Zhao, Jing Liu, Jijun Zhang, Ruifang He, Yuexian Hou

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16192 2024-03-01 cs.CL 74%

Defending Large Language Models against Jailbreak Attacks via Semantic Smoothing

Jiabao Ji, Bairu Hou, Alexander Robey, George J. Pappas, Hamed Hassani, Yang Zhang, Eric Wong, Shiyu Chang

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19271 2023-10-31 cs.CL 74%

Learning to love diligent trolls: Accounting for rater effects in the dialogue safety task

Michael John Ilagan

专题命中 越狱攻击 :safety(title);分类 cs.CL

Comments Accept-Findings at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 73%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18721 2026-08-11 cs.LG cs.AI 版本更新 73%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26936 2026-06-26 cs.CR cs.CL cs.LG 新提交 73%

Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

普通人的越狱:通过多臂老虎机算法选择最优越狱以自动增强查询

Prarabdh Shukla, Ritik, Suhas Rao, Arpit Agarwal, Arjun Bhagoji

机构 * Centre for Machine Intelligence and Data Science, IIT Bombay(印度理工学院班加罗尔机器智能与数据科学中心) Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔计算机科学与工程系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 提出基于多臂老虎机框架的越狱攻击策略,在线学习最优越狱方法,并构建包含11,279个恶意查询的安全基准FrankensteinBench,实验表明对15个开源LLM平均成功率高达97%。

详情

展开后加载摘要…

URL PDF HTML 收藏