arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2403.02910 2025-09-30 cs.CV cs.AI 77%

ImgTrojan: Jailbreaking Vision-Language Models with ONE Image

Xijia Tao, Shuai Zhong, Lei Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00827 2025-09-26 cs.CV cs.AI 77%

IDEATOR: Jailbreaking and Benchmarking Large Vision-Language Models Using Themselves

Ruofan Wang, Juncheng Li, Yixu Wang, Bo Wang, Xiaosen Wang, Yan Teng, Yingchun Wang, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08000 2025-09-11 cs.CL 77%

AntiDote: Bi-level Adversarial Training for Tamper-Resistant LLMs

Debdeep Sanyal, Manodeep Ray, Murari Mandal

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07646 2025-08-12 cs.LG 77%

Multi-Turn Jailbreaks Are Simpler Than They Seem

Xiaoxue Yang, Jaeha Lee, Anna-Katharina Dick, Jasper Timm, Fei Xie, Diogo Cruz

机构 * Imperial College London(伦敦帝国学院) California Institute of Technology(加州理工学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.LG

Comments 25 pages, 15 figures. Accepted at COLM 2025 SoLaR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16447 2025-06-23 cs.CR cs.CL 77%

Probe before You Talk: Towards Black-box Defense against Backdoor Unalignment for Large Language Models

Biao Yi, Tiansheng Huang, Sishuo Chen, Tong Li, Zheli Liu, Zhixuan Chu, Yiming Li

机构 * College of Cyber Science, Nankai University(南开大学网络科学学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Nanyang Technological University(新加坡国立大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted at ICLR 2025

Journal ref Proceedings of The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12274 2025-06-17 cs.CR cs.CL 77%

InfoFlood: Jailbreaking Large Language Models with Information Overload

Advait Yadav, Haibo Jin, Man Luo, Jun Zhuang, Haohan Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11647 2025-05-30 cs.CR cs.AI 77%

DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing

Yi Wang, Fenghua Weng, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16727 2025-01-31 cs.CL 77%

xJailbreak: Representation Space Guided Reinforcement Learning for Interpretable LLM Jailbreaking

Sunbowen Lee, Shiwen Ni, Chi Wei, Shuaimin Li, Liyang Fan, Ahmadreza Argha, Hamid Alinejad-Rokny, Ruifeng Xu, Yicheng Gong, Min Yang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12192 2024-12-18 cs.CR cs.AI 77%

No Free Lunch for Defending Against Prefilling Attack by In-Context Learning

Zhiyu Xue, Guangliang Liu, Bocheng Chen, Kristen Marie Johnson, Ramtin Pedarsani

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08615 2024-12-17 cs.CL 77%

Exploiting the Index Gradients for Optimization-Based Jailbreaking on Large Language Models

Jiahui Li, Yongchang Hao, Haoyu Xu, Xing Wang, Yu Hong

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 13 pages,2 figures, accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07921 2024-11-26 cs.CL 77%

AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs

Zeyi Liao, Huan Sun

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Published as a conference paper at COLM 2024 (https://colmweb.org/index.html)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21659 2024-10-18 cs.CL 77%

Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models

Yue Xu, Xiuyuan Qi, Zhan Qin, Wenjie Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments 12 pages, 9 figures, EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05880 2024-07-04 cs.CL 77%

Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge

Weikai Lu, Ziqian Zeng, Jianwei Wang, Zhengdong Lu, Zelin Chen, Huiping Zhuang, Cen Chen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09827 2024-03-01 cs.CL 77%

Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking

Nan Xu, Fei Wang, Ben Zhou, Bang Zheng Li, Chaowei Xiao, Muhao Chen

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01386 2024-01-23 cs.CL 77%

Who is ChatGPT? Benchmarking LLMs' Psychological Portrayal Using PsychoBench

Jen-tse Huang, Wenxuan Wang, Eric John Li, Man Ho Lam, Shujie Ren, Youliang Yuan, Wenxiang Jiao, Zhaopeng Tu, Michael R. Lyu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

Comments Accepted for ICLR 2024 Oral Presentation. 15 pages (main text) and 5 pages (appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08729 2025-10-10 cs.CL cs.AI 76%

X-Teaming Evolutionary M2S: Automated Discovery of Multi-turn to Single-turn Jailbreak Templates

Hyunjun Kim, Junwoo Ha, Sangyoon Yu, Haon Park

机构 * AIM Intelligence(AIM智能)

专题命中 越狱攻击 :jailbreak(title);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Workshop on Lock-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25255 2026-07-31 cs.MA cs.CR 版本更新 75%

SafeFlow: Semantic Information-Flow Control for Blocking Malicious Propagation in Multi-Agent Systems

SafeFlow:用于多智能体系统中阻止恶意传播的语义信息流控制

Haowen Dai, Zonghao Ying, Wenfeng Li, Xiangfan Wu, Yisong Xiao, Tianyuan Zhang, Jiaye Lin, Lei Wei, Guangyuan Dong, Xitong Ling, Xixun Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 研究多智能体系统恶意传播问题,提出SafeFlow框架,将恶意跨智能体传播形式化为语义信息流问题,通过附加污点、传播及工作流级验证重建风险上下文,经测试降低攻击成功率,保持良性任务完成率,揭示系统缺乏跨委托边界保留风险语义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24897 2026-07-29 cs.CR 新提交 75%

TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models

TYPO:针对商业闭源图像生成模型的指令密集型视觉越狱

Meng Xie, Li Zeng, Hangtao Zhang, Xianlong Wang, Ziqi Zhou, Pengpeng Qiao, Zhetao Li

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究针对商业闭源图像生成模型安全漏洞,提出TYPO框架,通过自动生成对抗性排版提示,利用文本和视觉双通道策略空间及自适应组合搜索,有效实现指令密集型视觉越狱,性能优于其他攻击且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02961 2026-07-07 cs.CV cs.CR 新提交 75%

Overloading Large Vision-Language Models for Jailbreaking

通过信息过载对大型视觉语言模型进行越狱攻击

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-07-07 cs.CL cs.AI cs.LG 版本更新 75%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29441 2026-06-30 cs.CR cs.AI cs.CL cs.ET cs.LG 75%

Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense

关闭激活锥盲点:响应时间探测与统一防御

Subhadip Mitra

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型推理时安全方法,发现提示时激活防御对预填充攻击存在结构性盲点,提出响应时间探测(线性探针)结合停止机制,将预填充攻击成功率降至0,并与AlphaSteer组合实现正交防御。

Comments 27 pages, 12 figures, 18 tables. Code and data: https://github.com/bassrehab/response-time-probing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25182 2026-06-25 cs.CL cs.AI cs.LG 新提交 75%

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

中间层知道什么:从熵动力学检测越狱

Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

机构 * LMU Munich(慕尼黑大学) relAI – Konrad Zuse School of Excellence in Reliable AI(relAI – 康拉德·楚泽可靠人工智能卓越学校) University of Pisa(比萨大学) Munich Center for Machine Learning(慕尼黑机器学习中心) School of Engineering, Computing and Mathematics, Oxford Brookes University(牛津布鲁克斯大学工程、计算与数学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析冻结LLM各层的token级预测熵轨迹,发现中间层的熵动力学特征(如基于排名的单调趋势分数)能有效检测越狱攻击,且无需额外训练。

Comments Accepted at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD) 2026. A short version accepted at EIML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 75%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 75%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11309 2026-04-14 cs.CR cs.AI cs.CL cs.CV cs.LG 75%

The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems

切肉威胁:在LLM系统中利用累积风险

Yihao Zhang, Kai Wang, Jiangrong Wu, Haolin Wu, Yuxuan Zhou, Zeming Wei, Dongxian Wu, Xun Chen, Jun Sun, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Sun Yat-sen University(中山大学) Wuhan University(武汉大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ByteDance(字节跳动) Singapore Management University(新加坡管理大学)

专题命中 越狱攻击 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Salami Slicing Risk,通过链式低风险输入累积有害意图,以触发高风险行为,提出Salami Attack框架并验证其有效性,同时提出防御策略以缓解多轮 jailbreak 风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21540 2026-04-09 cs.CR cs.CV 75%

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking

PRISM:基于图像序列操作的程序化推理用于LVLM劫持

Quanchen Zou, Zonghao Ying, Moyang Chen, Wenzhuo Xu, Yisong Xiao, Yakai Li, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。

Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 75%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 75%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08741 2026-02-10 cs.CR 75%

Large Language Lobotomy: Jailbreaking Mixture-of-Experts via Expert Silencing

大语言模型的脑部手术:通过专家沉默进行混合专家模型的劫持

Jona te Lintelo, Lichao Wu, Stjepan Picek

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 通过专家沉默技术,L$^3$攻击显著提高了MoE LLMs的劫持成功率,揭示了效率与安全之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04531 2026-02-03 cs.CL cs.AI cs.LG 75%

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

DP-Fusion: 令牌级差分隐私推理用于大语言模型

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。

Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com

详情

展开后加载摘要…

URL PDF HTML 收藏