arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1715 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1715 篇

2411.11496 2024-12-02 cs.CL 85%

Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models

Chenhang Cui, Gelei Deng, An Zhang, Jingnan Zheng, Yicong Li, Lianli Gao, Tianwei Zhang, Tat-Seng Chua

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16642 2024-11-26 cs.CR cs.CL 85%

Preventing Jailbreak Prompts as Malicious Tools for Cybercriminals: A Cyber Defense Perspective

Jean Marie Tshimula, Xavier Ndona, D'Jeff K. Nkashama, Pierre-Martin Tardif, Froduald Kabanza, Marc Frappier, Shengrui Wang

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11407 2024-11-19 cs.LG 85%

The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models

Xikang Yang, Xuehai Tang, Jizhong Han, Songlin Hu

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14177 2024-10-04 cs.CR cs.AI 85%

PathSeeker: Exploring LLM Security Vulnerabilities with a Reinforcement Learning-Based Jailbreak Approach

Zhihao Lin, Wei Ma, Mingyi Zhou, Yanjie Zhao, Haoyu Wang, Yang Liu, Jun Wang, Li Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

Comments update the abstract and cite a new related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00292 2024-09-20 cs.CL 85%

Enhancing Jailbreak Attacks with Diversity Guidance

Xu Zhang, Dinghao Jing, Xiaojun Wan

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18166 2024-06-17 cs.AI 85%

Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing

Wei Zhao, Zhe Li, Yige Li, Ye Zhang, Jun Sun

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14023 2024-05-24 cs.LG 85%

WordGame: Efficient & Effective LLM Jailbreak via Simultaneous Obfuscation in Query and Response

Tianrong Zhang, Bochuan Cao, Yuanpu Cao, Lu Lin, Prasenjit Mitra, Jinghui Chen

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 85%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00267 2026-05-04 cs.LG cs.AI cs.CR 85%

Jailbroken Frontier Models Retain Their Capabilities

突破边界模型仍保留其能力

Daniel Zhu, Zihan Wang, Jenny Bao, Jerry Wei

机构 * Anthropic

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,模型能力越强,越能抵御 jailbreak,且推理任务比知识回忆任务更易受攻击,边界点 jailbreaking 几乎无损安全模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13482 2026-08-14 cs.LG cs.AI cs.CL 新提交 85%

Synthetic Persona Pretraining: Alignment from Token Zero

合成角色预训练:从零开始的对齐

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

机构 * EPFL(洛桑联邦理工学院) University of Toronto(多伦多大学) Northeastern University(东北大学) SJTU(上海交通大学) Saarland University(萨尔大学) Hereon(亥姆霍兹极地与海洋研究中心) TUHH(汉堡工业大学) Ontocord AI(Ontocord人工智能公司) TUC(德累斯顿工业大学) DFKI(德国人工智能研究中心)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14147 2026-07-17 cs.CL cs.AI cs.CR cs.LG 新提交 85%

Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak

上半场打破拒绝:预填充越狱的机制研究

Alex Kwon

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型中预填充消除拒绝的现象,通过实验定位到早期窗口,揭示拒绝是浅层响应端计算,预填充控制是通用自回归条件作用,还明确了主导机制及相关特征,指出监测器免疫特点和机制的分散性与失效表面的局部性。

Comments 31 pages, 3 figures. Code and derived artifacts: https://github.com/collapseindex/breaking-refusal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 85%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19011 2026-06-16 cs.CR cs.AI cs.CL cs.LG 版本更新 85%

Do You Really Need a GPU to Guard Your LLM? CPU-Class Classifiers and Multi-Stage Pipelines for Safety Enforcement at Scale

你真的需要GPU来保护你的LLM吗?用于大规模安全执行的CPU级分类器与多阶段流水线

Vasudev Majhi, Dhruv Gupta, Advait Singh, Matthew Barker, Dhruv Kumar

机构 * BITS Pilani(比斯帕利尼大学) Trustwise(Trustwise公司)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究CPU级分类器(如SVM、梯度提升树)在LLM输入安全检测中的性能,发现其与GPU模型互补,并设计三阶段流水线GuardChain,在80%的分布内查询中达到近峰值精度,降低部署成本。

Comments Under Review. 25 pages, 5 figures, 38 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07335 2026-06-08 cs.CR 新提交 85%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-05-28 cs.CR cs.AI cs.CL cs.LG cs.MA 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24550 2026-05-26 cs.AI cs.CL cs.LG 85%

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

越狱以保护:通过临时越狱进行缓冲和强化以实现大型语言模型的安全微调

Seokil Ham, Jaehyuk Jang, Wonjun Lee, Changick Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电子工程学院)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调即服务中安全对齐被有害微调攻击削弱的问题,提出一种基于梯度分析的缓冲与强化框架,通过临时越狱适配器减少有害更新并利用QR分解合并强化安全,实现无需额外安全数据的高效防御。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15362 2026-05-20 cs.LG cs.AI cs.CL cs.CR 85%

Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models

Faster-GCG: 面向对齐大语言模型的高效离散优化监狱突破攻击

Xiao Li, Wei Zhang, Zhuhong Li, Qiongxiu Li, Shei PernChua, BingZe Lee, Jinghao Cui, Yifan Huang, Xiaolin Hu

机构 * Tsinghua University(清华大学) Sea-Fill Duke University(杜克大学) Aalborg University(奥胡斯大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Faster-GCG,通过改进估计、高效采样和避免重复评估,提高了对齐大语言模型的监狱突破攻击效率,实现了样本效率提升8倍,时间减少7倍,并在多个模型上取得了更高的突破成功率。

Comments 18 pages, new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18168 2026-05-19 cs.CR cs.SD 85%

Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models

声学干扰:利用声学潜在语义进行通用劫持的新范式,针对大型音频语言模型

Yanyun Wang, Yu Huang, Zi Liang, Xixin Wu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出了一种新的声学干扰方法,通过利用声学潜在语义对大型音频语言模型进行通用劫持,揭示了安全对齐的脆弱性。

Comments 43rd International Conference on Machine Learning (ICML'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02280 2026-05-13 cs.SE cs.AI cs.CL cs.CR cs.LG 85%

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

RACC:面向LLM安全测试的表示感知覆盖标准

Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * Peking University(北京大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RACC,一种专为LLM安全测试设计的覆盖标准,通过提取安全表示并评估测试提示的激活情况,有效提升测试套件质量,同时对冗余输入不敏感,适用于大规模神经网络的安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07399 2026-05-12 cs.CV 85%

GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization

GPO-V:通过全局概率优化实现扩散视觉语言模型的突破

Yu Pan, Andi Zhang, Yi Wang, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) University of Warwick(沃里克大学) SUN YAT-SEN UNIVERSITY(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出GPO-V,通过全局概率优化方法突破扩散视觉语言模型的安全防线,揭示了非顺序生成架构中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16737 2026-04-24 cs.LG cs.AI cs.CL cs.CR math.OC 85%

Secure LLM Fine-Tuning via Safety-Aware Probing

通过安全感知探测实现安全的大语言模型微调

Chengcan Wu, Zhixin Zhang, Zeming Wei, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了非有害数据微调为何可能降低安全性,提出安全感知探测框架,通过对比安全信号定位安全相关方向,优化轻量级探针以引导参数更新远离有害轨迹,提升安全与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 85%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22094 2026-03-26 cs.CV 85%

Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models

通过空域投影实现原理化引导用于视觉-语言模型中的对抗防御

Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(北京信息科技大学MoE关键实验室,中国科学技术大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出NullSteer框架,通过线性变换在模型激活中构建拒绝方向,在良性子空间保持零扰动,动态诱导拒绝有害方向,提升安全性而不损害模型能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14219 2026-03-17 cs.CV 85%

Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining

安全潜力修剪:提升对抗VLM劫持的安全提示而无需重新训练

Chongxin Li, Hanzhang Wang, Lian Duan

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 本文提出安全潜力修剪方法,通过去除对安全提示不敏感的权重,增强安全路径,提升VLM对抗能力,减少攻击成功率22%。

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21184 2026-01-27 cs.LG cs.AI cs.CL 85%

Jailbreak-as-a-Service++: Unveiling Distributed AI-Driven Malicious Information Campaigns Powered by LLM Crowdsourcing

Jailbreak-as-a-Service++:揭示由LLM众包驱动的分布式恶意信息活动

Yu Yan, Sheng Sun, Mingfeng Li, Yunlong Song, Xingzhou Zhang, Linran Lu, Zhifei Zheng, Min Liu, Qi Li

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) China People’s Public Security University(中国人民公安大学) Tongji University(同济大学) South China Normal University(华南师范大学) Tsing Hua University(清华大学)

专题命中 越狱攻击 :jailbreak(title);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jailbreak-as-a-Service++研究通过LLM众包技术揭示分布式恶意信息活动,提出PoisonSwarm方法提升恶意任务生成效率并提出生态系统级防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12880 2025-12-23 cs.CR 85%

Universal Jailbreak Suffixes Are Strong Attention Hijackers

通用劫持后缀是强大的注意力劫持者

Matan Ben-Tov, Mor Geva, Mahmood Sharif

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文研究了基于后缀的劫持攻击,发现通用后缀能更有效地劫持LLM的上下文化过程,并提出通过提升后缀普遍性来增强攻击效果,同时提供缓解方法。

Comments Accepted at TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06589 2025-12-09 cs.CR cs.CV 85%

OmniSafeBench-MM: A Unified Benchmark and Toolbox for Multimodal Jailbreak Attack-Defense Evaluation

OmniSafeBench-MM:多模态 jailbreak 攻击-防御评估的统一基准和工具箱

Xiaojun Jia, Jie Liao, Qi Guo, Teng Ma, Simeng Qin, Ranjie Duan, Tianlin Li, Yihao Huang, Zhitao Zeng, Dongxian Wu, Yiming Li, Wenqi Ren, Xiaochun Cao, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学) BraneMatrix AI, China(BraneMatrix AI) Chongqing University, China(重庆大学) Xi’an Jiaotong University, China(西安交通大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) Alibaba, China(阿里巴巴) National University of Singapore, Singapore(新加坡国立大学) ByteDance, China(字节跳动)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 OmniSafeBench-MM提供一个多模态jailbreak攻击-防御评估的统一基准和工具箱,整合13种攻击方法、15种防御策略及广泛数据集,通过三维评估协议深入分析安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 85%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02833 2025-11-27 cs.CR 85%

Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs

通过过拟合攻击:10次良性微调以劫持LLMs

Zhixin Xie, Xurui Song, Jun Luo

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 通过10个良性QA对微调实现LLM劫持,利用过拟合增强敏感性,提升攻击效果与隐蔽性。

Comments Published as a conference paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13334 2025-11-26 cs.CL cs.AI cs.LG 85%

BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models

BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞

Isack Lee, Haebin Seong

机构 * Theori Inc.(Theori公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。

Comments Accepted as a workshop paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏