arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2602.22983 2026-03-25 cs.AI cs.CR 83%

Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search

晦涩但有效的:基于生物启发搜索的古典中文 Jailbreak 提示优化

Xun Huang, Simeng Qin, Xiaoshuang Jia, Ranjie Duan, Huanqian Yan, Zhitao Zeng, Fei Yang, Yang Liu, Xiaojun Jia

机构 * Nanyang Technological University(南洋理工大学) BraneMatrix AI Nanjing University of Science and Technology(南京理工大学) Northeast University(东北大学) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团) Beihang University(北航) National University of Singapore(新加坡国立大学) Zhejiang Lab(浙江实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出 CC-BOS 框架,利用多维果蝇优化算法生成古典中文对抗提示,提升黑盒 Jailbreak 攻击效果,通过八维政策维度迭代优化,实验表明其优于现有方法。

Comments ICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10766 2026-03-25 cs.CR cs.AI cs.CV 83%

Metaphor-based Jailbreak Attacks on Text-to-Image Models

基于隐喻的文本到图像模型劫持攻击

Chenyu Zhang, Lanjun Wang, Yiwen Ma, Wenhui Li, Yi Tu, An-An Liu

机构 * Huawei Technologies Co Ltd.(华为技术有限公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基于隐喻的劫持攻击方法,通过生成隐喻对抗提示绕过未知或多样化的防御机制,实验表明其在攻击性能和查询效率方面优于基线方法。

Comments Code is available in \url{https://github.com/datar001/metaphor-based-jailbreaking-attack}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10971 2026-03-20 cs.CR cs.CL 83%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16192 2026-03-18 cs.CL 83%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14825 2026-03-17 cs.CV cs.AI 83%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23404 2026-03-17 cs.CL 83%

AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models

AJF:基于黑盒大语言模型理解能力的自适应突破框架

Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 83%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04896 2026-02-06 cs.CR cs.AI 83%

Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models

转向外部性:良性激活转向无意中增加大语言模型的劫持风险

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Ching-Yun Ko, Tsung-Yi Ho

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了大语言模型中良性激活转向对安全性的负面影响,发现其无意中增加劫持风险,并通过实验验证了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04204 2026-02-03 cs.LG cs.CR stat.ML 83%

Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence

短长度对抗训练有助于LLMs防御长长度劫持攻击:理论和实证证据

Shaopeng Fu, Liang Ding, Jingfeng Zhang, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) The University of Sydney(悉尼大学) The University of Auckland(奥克兰大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文提出通过短长度对抗训练有效防御长长度劫持攻击,理论和实验证实了这种策略的可行性。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20903 2026-01-30 cs.CR cs.AI 83%

ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack

ICON:意图-上下文耦合用于高效的多轮 jailbreak 攻击

Xingwei Lin, Wenhao Lin, Sicong Cao, Jiahao Yu, Renke Huang, Lei Xue, Chunming Wu

机构 * Zhejiang University(浙江大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Northwestern University(西北大学) Sun Yat-sen University(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 ICON 提出了一种高效的多轮 jailbreak 攻击框架,通过意图-上下文耦合和分层优化策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15801 2026-01-27 cs.LG cs.CR 83%

Attributing and Exploiting Safety Vectors through Global Optimization in Large Language Models

通过全局优化在大语言模型中归因和利用安全向量

Fengheng Chu, Jiahao Chen, Yuhong Wang, Jun Wang, Zhihui Fu, Shouling Ji, Songze Li

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) OPPO Research Institute(OPPO研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过全局优化方法识别大语言模型中的安全向量,揭示安全机制的协作交互,并提出新的白盒劫持方法提升攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01631 2026-01-22 cs.AI 83%

Unraveling LLM Jailbreaks Through Safety Knowledge Neurons

通过安全知识神经元揭开大语言模型劫持的面纱

Chongwen Zhao, Yutong Ke, Kaizhu Huang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SafeTuning方法,通过调整安全知识神经元激活来提升大语言模型对劫持攻击的防御能力,实验显示其在多个模型上均有效

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13201 2026-01-06 cs.CR cs.LG cs.MA 83%

CEE: An Inference-Time Jailbreak Defense for Embodied Intelligence via Subspace Concept Rotation

CEE: 通过子空间概念旋转实现体智能中的推断时间劫持防御

Jirui Yang, Zheyu Lin, Zhihui Lu, Yinggui Wang, Lei Wang, Tao Wei, Qiang Duan, Xin Du, Shuhan Yang

机构 * Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Ant Group(蚂蚁集团) Pennsylvania State University(宾夕法尼亚州立大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

AI总结 CEE通过动态构建子空间并应用SLERP旋转,实现体智能系统中高效的推断时间劫持防御,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23173 2025-12-30 cs.CR cs.AI 83%

EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion

EquaCode:通过方程求解和代码补全的多策略对抗大语言模型

Zhen Liang, Hai Huang, Zhengkui Chen

机构 * School of Computer Science and Technology, Zhejiang Sci-Tech University, Hangzhou, China(计算机科学与技术学院,浙江科技学院,杭州,中国)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 EquaCode通过方程求解和代码补全提出多策略对抗方法,有效提升大语言模型的鲁棒性。

Comments This is a preprint. A revised version will appear in the Proceedings of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02080 2025-12-25 cs.CR cs.AI 83%

Evolving Security in LLMs: A Study of Jailbreak Attacks and Defenses

LLM安全性的演变:对劫持攻击及防御的研究

Zhengchun Shang, Wenlan Wei, Weiheng Bai

机构 * Cornell University Ithaca, NY Department of Computer Science \& Engineering University of Minnesota -- Twin Cities Minneapolis, MN

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了LLM安全性的演变,分析了劫持攻击的检测技术,并探讨了模型版本、大小及多防御策略对安全性的综合影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11185 2025-12-23 cs.CR cs.AI 83%

Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks

出血路径:LLM隐藏状态中的判别能力消失加剧了 jailbreak 攻击

Yingjie Zhang, Tong Liu, Zhe Zhao, Guozhu Meng, Kai Chen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Ant Group(蚂蚁集团)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本研究提出DEEPALIGN框架,通过增强LLM隐藏状态的分离度,有效缓解jailbreak攻击,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02973 2025-12-03 cs.CV cs.CL cs.CR 83%

Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities

基于上下文的图像攻击:如何通过视觉上下文暴露多模态安全漏洞

Yuan Xiong, Ziqi Miao, Lijun Li, Chen Qian, Jie Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出上下文图像攻击方法,通过多智能体系统和四种可视化策略,有效利用图像的上下文信息对多模态大语言模型进行劫持攻击,实验结果显示攻击效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18933 2025-11-25 cs.CR cs.AI 83%

Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations

用负责任的AI考虑来防御大型语言模型对抗劫持攻击

Ryan Wong, Hosea David Yu Fei Ng, Dhananjai Sharma, Glenn Jun Jie Ng, Kavishvaran Srinivasan

机构 * National University of Singapore(新加坡国立大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。

Comments 20 pages including appendix; technical report; NeurIPS 2024 style

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12217 2025-11-18 cs.LG 83%

AlignTree: Efficient Defense Against LLM Jailbreak Attacks

Gil Goren, Shahar Katz, Lior Wolf

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.LG

Comments Accepted as an Oral Presentation at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26096 2025-10-31 cs.SD cs.CR cs.LG 83%

ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models

Weifei Jin, Yuxin Cao, Junjie Su, Minhui Xue, Jie Hao, Ke Xu, Jin Song Dong, Derui Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) CSIRO’s Data61(CSIRO数据61) Responsible AI Research (RAIR) Centre, The University of Adelaide(负责任人工智能研究(RAIR)中心,阿德莱德大学) Tsinghua University(清华大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17006 2025-10-21 cs.CL 83%

Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization

Masahiro Kaneko, Zeerak Talat, Timothy Baldwin

机构 * MBZUAI(马克斯·普朗克人工智能研究所) University of Edinburgh(爱丁堡大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10597 2025-10-17 cs.CR cs.AI 83%

SoK: Evaluating Jailbreak Guardrails for Large Language Models

Xunguang Wang, Zhenlan Ji, Wenxuan Wang, Zongjie Li, Daoyuan Wu, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) Lingnan University(岭南大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

Comments Accepted by IEEE S&P 2026 Cycle 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13541 2025-10-17 eess.AS cs.LG 83%

SPIRIT: Patching Speech Language Models against Jailbreak Attacks

Amirbek Djanibekov, Nurdaulet Mukhituly, Kentaro Inui, Hanan Aldarmaki, Nils Lukas

机构 * MBZUAI Tohoku University(东北大学) RIKEN(日本科学技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01586 2025-10-03 cs.AI 83%

AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning

Zhenyu Pan, Yiting Zhang, Zhuo Liu, Yolo Yunlong Tang, Zeliang Zhang, Haozheng Luo, Yuwei Han, Jianshu Zhang, Dennis Wu, Hong-Yu Chen, Haoran Lu, Haoyang Fang, Manling Li, Chenliang Xu, Philip S. Yu, Han Liu

机构 * Northwestern University(西北大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26345 2025-10-01 cs.AI 83%

SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models

Qinjian Zhao, Jiaqi Wang, Zhiqiang Gao, Zhihao Dou, Belal Abuhaija, Kaizhu Huang

机构 * Wenzhou-Kean University(温州市凯恩大学) University of Bremen(不莱梅大学) Case Western Reserve University(凯斯西储大学) Duke Kunshan University(杜克昆山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12299 2025-10-01 cs.CR cs.AI 83%

QGuard:Question-based Zero-shot Guard for Multi-modal LLM Safety

Taegyeong Lee, Jeonghwa Yoo, Hyoungseo Cho, Soo Yong Kim, Yunho Maeng

机构 * FnGuide Inc.(FnGuide公司) Safe Generative AI Lab, MODULABS(MODULABS安全生成AI实验室) A.I.MATICS Inc.(A.I.MATICS公司) Ewha Womans University(成均馆大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

Comments Accept to ACLW 2025 (WOAH); fix typo

Journal ref ACL Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21360 2025-09-29 cs.CV cs.AI 83%

Multimodal Prompt Decoupling Attack on the Safety Filters in Text-to-Image Models

Xingkai Peng, Jun Jiang, Meng Tong, Shuai Li, Weiming Zhang, Nenghai Yu, Kejiang Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12970 2025-09-23 cs.CL 83%

Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking

Junda Zhu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin, Lei Sha

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司) Zhongguancun Laboratory(中关村实验室)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09334 2025-09-18 cs.CR cs.AI 83%

CyberLLMInstruct: A Pseudo-malicious Dataset Revealing Safety-performance Trade-offs in Cyber Security LLM Fine-tuning

Adel ElZemity, Budi Arief, Shujun Li

机构 * University of Kent(肯特大学)

专题命中 越狱攻击 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15648 2025-08-27 cs.CL 83%

SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models

Peng Ding, Wen Sun, Dailin Li, Wei Zou, Jiaming Wang, Jiajun Chen, Shujian Huang

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 (Main Conference), 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏