arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2403.12075 2024-05-15 cs.CY cs.AI cs.CR cs.CV cs.LG 67%

Adversarial Nibbler: An Open Red-Teaming Method for Identifying Diverse Harms in Text-to-Image Generation

Jessica Quaye, Alicia Parrish, Oana Inel, Charvi Rastogi, Hannah Rose Kirk, Minsuk Kahng, Erin van Liemt, Max Bartolo, Jess Tsang, Justin White, Nathan Clement, Rafael Mosquera, Juan Ciro, Vijay Janapa Reddi, Lora Aroyo

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13507 2024-03-22 cs.CV 67%

FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs

Jinmin Li, Kuofeng Gao, Yang Bai, Jingyun Zhang, Shu-tao Xia, Yisen Wang

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04769 2024-03-12 cs.CR cs.AI cs.CL cs.LG 67%

Using Hallucinations to Bypass GPT4's Filter

Benjamin Lemkin

专题命中 越狱攻击 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09674 2024-02-16 cs.CL cs.AI cs.CR cs.LG 67%

PAL: Proxy-Guided Black-Box Attack on Large Language Models

Chawin Sitawarin, Norman Mu, David Wagner, Alexandre Araujo

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03348 2023-11-27 cs.CL cs.AI cs.LG 67%

Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation

Rusheb Shah, Quentin Feuillade--Montixi, Soroush Pour, Arush Tagade, Stephen Casper, Javier Rando

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03495 2023-10-20 cs.CL cs.AI cs.LG 67%

Automatic Prompt Optimization with "Gradient Descent" and Beam Search

Reid Pryzant, Dan Iter, Jerry Li, Yin Tat Lee, Chenguang Zhu, Michael Zeng

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17410 2023-10-02 cs.CL cs.AI cs.LG 67%

Can Sensitive Information Be Deleted From LLMs? Objectives for Defending Against Extraction Attacks

Vaidehi Patil, Peter Hase, Mohit Bansal

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Equal contribution from first two authors. 19 pages, 5 figures. Our code is available at: https://github.com/Vaidehi99/InfoDeletionAttacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11521 2023-08-28 cs.CL cs.AI cs.LG 67%

Self-Deception: Reverse Penetrating the Semantic Firewall of Large Language Models

Zhenhua Wang, Wei Xie, Kai Chen, Baosheng Wang, Zhiwen Gui, Enze Wang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Serious errors were found in the experiment, which may lead to the overturning of the overall conclusions of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10443 2023-08-22 cs.AI cs.CL cs.CY 67%

Using Large Language Models for Cybersecurity Capture-The-Flag Challenges and Certification Questions

Wesley Tann, Yuancheng Liu, Jun Heng Sim, Choon Meng Seah, Ee-Chien Chang

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.08005 2023-05-16 cs.CR cs.AI cs.CL cs.CY cs.HC 67%

Beyond the Safeguards: Exploring the Security Risks of ChatGPT

Erik Derner, Kristina Batistič

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24014 2026-06-24 cs.AI cs.CL 新提交 66%

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

强化学习迈向广泛且持久有益的模型

Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal

机构 * OpenAI

专题命中 越狱攻击 :alignment(abstract,comments);分类 cs.CL、cs.AI

AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。

Comments Blog: https://alignment.openai.com/beneficial-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20242 2026-06-10 cs.CY cs.AI cs.RO 版本更新 66%

BadRobot: Jailbreaking Embodied LLM Agents in the Physical World

BadRobot: 在物理世界中越狱具身LLM智能体

Hangtao Zhang, Chenyu Zhu, Xianlong Wang, Ziqi Zhou, Changgan Yin, Minghui Li, Lulu Xue, Yichen Wang, Shengshan Hu, Aishan Liu, Peijin Guo, Leo Yu Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Beihang University(北航) Griffith University(格里菲斯大学)

专题命中 越狱攻击 :safety(abstract,comments);分类 cs.AI、cs.CY

AI总结 提出BadRobot攻击范式,利用LLM在机器人系统中的操纵、语言输出与物理动作的错位以及世界知识缺陷三个漏洞,通过语音交互使具身LLM执行有害行为,并在基准测试中验证了有效性。

Comments Accepted to ICLR 2025. Please cite the conference version. Project page: https://Embodied-LLMs-Safety.github.io

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09527 2022-11-18 cs.CL cs.AI 66%

Ignore Previous Prompt: Attack Techniques For Language Models

Fábio Perez, Ian Ribeiro

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI;safety(comments)

Comments ML Safety Workshop NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11624 2026-08-13 cs.CL cs.AI 新提交 62%

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 62%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06779 2026-08-10 q-bio.QM cs.AI cs.CL 新提交 62%

Genotypic Triggers: Exposing Pharmacogenomic Blind Spots via Host-Specific Backdoors in Generative Antimicrobial Peptide Models

基因型触发器:通过生成抗菌肽模型中宿主特定后门暴露药物基因组学盲区

Doniyorkhon Obidov, Xiaolong Guo, Yonghui Li, Kaichen Yang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基因型触发器后门攻击,操控抗菌肽生成模型使其针对特定HLA等位基因携带者生成高免疫原性风险肽,同时保留抗菌效力与低毒性,以暴露药物基因组学盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03070 2026-08-07 cs.CR cs.AI cs.CL 版本更新 62%

AI Security Leaderboard: Methodology, Results and Minimal Standard

AI安全排行榜:方法、结果与最低标准

Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15560 2026-08-06 cs.CR cs.AI cs.LG 交叉投稿 62%

Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models

时序上下文感知:一种针对大型语言模型多轮操纵攻击的防御框架

Prashant Kulkarni, Assaf Namer

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLMs易受多轮操纵攻击的问题,本文提出TCA框架,通过分析语义漂移等实现防御,初步评估显示其能识别传统方法遗漏的微妙操纵模式,为对话式AI系统提供安全保障。

Comments 6 pages, 2 figures, IEEE CAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10933 2026-08-04 cs.CR cs.AI cs.CV cs.LG quant-ph 版本更新 62%

QShield: Securing Neural Networks Against Adversarial Attacks using Quantum Circuits

QShield: 通过量子电路安全神经网络对抗对抗性攻击

Navid Azimi, Aditya Prakash, Yao Wang, Li Xiong

机构 * Emory University(埃默里大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 QShield通过结合传统CNN和量子处理模块,提升经典深度学习模型的对抗鲁棒性,实验表明其在多种数据集上有效降低攻击成功率并提高预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25479 2026-07-29 cs.CR cs.AI cs.LG 新提交 62%

Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

通过表示引导在视觉语言模型供应链中植入架构后门

Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24339 2026-07-28 cs.AI cs.CL 新提交 62%

Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families

Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证

Dushyant Sharma

机构 * Gubernaut Research(Gubernaut研究)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。

Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23849 2026-07-27 cs.CR cs.AI cs.DC cs.LG 版本更新 62%

Security Without Detection: Economic Denial as a Primitive for Edge and IoT Defense

无需检测的安全:经济否认作为边缘和物联网防御的基本原理

Samaresh Kumar Singh, Joyjit Roy, Sriharsha Anand Pushkala

机构 * st Samaresh Kumar Singh(第一作者机构) nd Joyjit Roy(第二作者机构)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 EDS是一种不依赖检测的物联网和边缘安全方法,通过经济成本放大机制有效遏制攻击,实现超线性成本增加和高缓解率。

Comments 8 pages, 2 figures, submitted to 3rd International Conference on Intelligent Digitization of Systems and Services (IDSS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31796 2026-07-24 cs.CL cs.AI 版本更新 62%

CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield

CHERRY: 具有循环表示收益的压缩层次专家

Dohyeon Kwon, Youngjin Park

机构 * TeamSparta Inc.(TeamSparta公司)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 提出三种互补技术训练计算高效语言模型:选择性监督与每令牌效率、深度压缩与循环恢复、压缩专家融合,在CHERRY-1.8B韩语模型上验证,实现参数减少2.5倍且性能接近。

Comments 64pp, LaTeX. v2 rebuilds arXiv:2606.31796 into a full report: matched-compute discrimination/generation dissociation, recurrent-yield compression (48->6)+MoEE, pre-registered 1B->13.7B H-PRESERVE, sovereign Korean tokenizer (+9.2% vs Gemma-4), government HLE(Ko) column lead, cyber specialization. Recurrent compression cited by Loopie (arXiv:2607.16051). Tables incl.; v1 in history

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18567 2026-07-22 cs.AI cs.CR cs.LG 新提交 62%

Attacking Graph Foundation Models Through Their Shared Representation

通过共享表示攻击图基础模型

Pankaj Kumar, Subhankar Mishra

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究通过攻击图基础模型的共享表示来探索其脆弱性,采用表示空间扰动和输入空间攻击等方法,针对六个公共模型进行实验,发现不同模型的脆弱性表现,如OpenGraph的频谱分词器有特定脆弱性,还分析了脆弱性与解码器读取表示的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 62%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07368 2026-07-09 cs.LG cs.AI cs.MA 新提交 62%

Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors

多智能体人工智能控制:分布式攻击阻碍实例级监测

Oliver Makins, Orazio Angelini, Zohreh Shams, Mary Phuong

机构 * MATS Research(MATS研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体人工智能控制中的分布式攻击,开发FakeLab代码库,评估单智能体监测应对分布式攻击的效果,发现碎片化效应,指出其与代码比例无关,受模型能力影响,还揭示显式规划器及不同强度监测的作用。

Comments Submitted to NeurIPS; 81 pages; 32 figures and 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 62%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23884 2026-07-02 cs.CL cs.AI 新提交 62%

One Year Later...The Harms Persist, But So Do We!

一年后...伤害持续,但我们仍在!

Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar, Anson Antony

机构 * Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。

Comments 20 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 62%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏