arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 15 篇

2608.09542 2026-08-11 cs.LG cs.AI cs.CR 新提交 90%

Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs

双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解

Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24191 2026-08-11 cs.CR cs.AI 版本更新 86%

When Grammar Guides the Attack: Uncovering Control-Plane Vulnerabilities in LLMs with Structured Output

当语法引导攻击:利用结构化输出揭示LLM中的控制平面漏洞

Shuoming Zhang, Jiacheng Zhao, Hanyuan Dong, Ruiyuan Xu, Zhicheng Li, Yangyu Zhang, Shuaijiang Li, Yuan Wen, Chunwei Xia, Zheng Wang, Xiaobing Feng, Huimin Cui

机构 * SKLP, ICT, CAS & UCAS(SKLP、信息科技研究院、中国科学院及中国科学院大学) University of Aberdeen(阿伯丁大学) University of Leeds(利兹大学) SKLP, ICT, CAS(SKLP、信息科技研究院、中国科学院)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了通过结构化输出揭示LLM控制平面漏洞的问题,提出了一种名为Constrained Decoding Attack(CDA)的新类别的 jailbreak 方法,通过控制到语义的管道机制,利用schema-enforced logit masking注入恶意前缀,并由模型自身完成有害意图,展示了DictAttack在多个模型上的高攻击成功率,揭示了需要跨平面防御来弥合数据和控制平面之间的语义差距。

Comments To appear in CCS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09095 2026-08-11 cs.AI 新提交 85%

Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways

谁搭建安全桥梁?识别并靶向跨语言共享安全路径

Shuyi Miao, Wangjie Qiu, Pengyang Shao, Canran Xiao, Fei Shen, Zhiming Zheng, Tat-Seng Chua

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 85%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 85%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25921 2026-08-11 cs.CL cs.CR 版本更新 83%

One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety

逐词进行:增量完成分解打破LLM安全

Samee Arif, Naihao Deng, Zhijing Jin, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Toronto(多伦多大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出增量完成分解(ICD)策略,通过逐词生成恶意请求相关词来突破LLM安全机制,评估多种变体在多个基准测试中表现优异,并理论解释其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16406 2026-08-11 cs.CR cs.CL 版本更新 83%

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Models

检索增强防御:针对大语言模型的自适应且可控制的越狱防范

Guangyu Yang, Jinghong Chen, Jingbiao Mei, Weizhe Lin, Bill Byrne

机构 * Department of Engineering University of Cambridge(工程系剑桥大学)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 针对大语言模型越狱攻击的挑战,提出检索增强防御(RAD)框架,在StrongREJECT数据集上验证其可降低强力越狱攻击有效性,同时平衡安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08383 2026-08-11 cs.CL cs.LG 新提交 81%

Safety Cost of Steering Vectors Is Separable and Reducible

引导向量的安全代价是可分离且可降低的

Yuxiao Li, Gjergji Kasneci

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26574 2026-08-11 cs.CR cs.AI cs.LG 版本更新 81%

Attack Ensembles Expose a Safety-Utility Trade-off in Black-Box Guard Defenses Against Encoded VLM Jailbreaks

恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术

Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Yi Feng, Xiao Luo, Zijian Xiao, Haowen Xu, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 73%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18721 2026-08-11 cs.LG cs.AI 版本更新 73%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09551 2026-08-11 cs.CL 新提交 70%

Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models

语用攻击面:大语言模型中隐式上下文的漏洞

Bocheng Chen, Han Zi, Roucheng Ou, Yawei Liu, Minyue Chen, Zimo Qi, Rongrong Wang, Guangliang Liu

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出大语言模型存在语用攻击面漏洞,利用人类语言解读与安全对齐的隐式上下文不匹配,所提攻击方法在各类模型上的成功率大幅优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08815 2026-08-11 cs.LG 新提交 70%

Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles

用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏

Pedram MohajerAnsari, Amir Salarpour, Mert D. Pesé

机构 * Clemson University(克莱姆森大学)

专题命中 越狱攻击 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01043 2026-08-11 cs.CR cs.AI 版本更新 70%

Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks

诱饵图像增强针对编码越狱的字幕介导防御

Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。

Comments There is bug in algorithm implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23341 2026-08-11 cs.CR cs.AI 版本更新 57%

Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards

评估部署于智能电网操作中的LLM jailbreaking漏洞:与NERC标准的基准测试

Taha Hammadia, Lucas Rea, Ahmad Mohammad Saber, Amr Youssef, Deepa Kundur

机构 * ECE Department, University of Toronto(多伦多大学电子工程系) CIISE, Concordia University(麦吉尔大学CIISE)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文评估了智能电网操作中部署LLM的jailbreaking漏洞,通过与NERC标准的基准测试,发现DeepInception方法攻击成功率最高,Claude 3.5 Haiku完全免疫,Gemini 2.0 Flash-Lite最易受攻击。

Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏