arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2502.15568 2025-11-12 cs.LG cs.AI 73%

A Cautionary Tale About "Neutrally" Informative AI Tools Ahead of the 2025 Federal Elections in Germany

Ina Dormuth, Sven Franke, Marlies Hafer, Tim Katzke, Alexander Marx, Emmanuel Müller, Daniel Neider, Markus Pauly, Jérôme Rutinowski

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

Journal ref Explainable Artificial Intelligence (xAI 2025). Communications in Computer and Information Science, vol. 2580, pp. 64-85. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08829 2025-10-13 cs.CR cs.AI cs.LG 73%

CommandSans: Securing AI Agents with Surgical Precision Prompt Sanitization

Debeshee Das, Luca Beurer-Kellner, Marc Fischer, Maximilian Baader

机构 * ETH Zurich(苏黎世联邦理工学院) Snyk(Snyk公司)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14231 2025-08-21 cs.CY cs.AI 73%

Incident Analysis for AI Agents

Carson Ezell, Xavier Roberts-Gaal, Alan Chan

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.CY

Comments 16 pages (10 pages main text), 4 figures, 3 tables. To be published in the Proceedings of the 2025 AAAI/ACM Conference on AI, Ethics, & Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06833 2025-02-03 cs.LG cs.CL 73%

Can LLMs Separate Instructions From Data? And What Do We Even Mean By That?

Egor Zverev, Sahar Abdelnabi, Soroush Tabesh, Mario Fritz, Christoph H. Lampert

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.LG

Comments Published as a conference paper at ICLR 2025, GitHub: https://github.com/egozverev/Shold-It-Be-Executed-Or-Processed. 10 pages main text, 30 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07992 2026-06-09 cs.AI cs.CR cs.SE 新提交 72%

VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation

VATS: 通过系统性变异利用错误路径注入中的隐式权威

Harshil Patel, Kunal Pai

机构 * Harshil Patel Kunal Pai

专题命中 提示注入 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI

AI总结 提出VATS框架,通过七维变异生成对抗性负载,利用错误消息的隐式权威绕过安全机制,在四个前沿模型上实现高达100%的注入成功率。

Comments Published at Second Workshop on Agents in the Wild: Safety, Security, and Beyond (ICML 2026 AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10281 2026-08-12 cs.CR 新提交 71%

From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

从提示注入到Web漏洞利用:重新审视集成大语言模型的应用中的经典漏洞

Spiros Tsigkopoulos, Christoforos Ntantogian

专题命中 提示注入 :prompt injection(title)

AI总结 本文研究集成大语言模型的Web应用的新型攻击LLM介导的Web攻击,提出LLM2X系列攻击类型,通过实现TicketOracle实验发现模型易感性差异,给出多层缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04741 2026-08-06 cs.CR 新提交 71%

LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents

LoginTrap:针对基于大语言模型的Web智能体的任务无关型钓鱼式间接提示注入攻击的发现

Longtao Guo, Zelin Zhang, Kaifeng Huang, Yang Shi

专题命中 提示注入 :prompt injection(title)

AI总结 该研究提出LoginTrap攻击,是针对基于LLM的Web智能体的任务无关型登录诱导攻击,在黑盒威胁模型下可达到86%的平均端到端攻击成功率,揭示了登录诱导的认证边界风险并推动相关防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20746 2026-06-23 cs.CR cs.LO 新提交 71%

Amplify, Don't Create: Temporal Accumulation for Slow-Burn Prompt Injection

放大而非创造:针对慢燃提示注入的时间累积

J Alex Corll

专题命中 提示注入 :prompt injection(title)

AI总结 针对工具使用智能体的控制平面攻击通过轨迹分布弱指令,代理端时间累积器通过峰值和CUSUM持久性统计恢复慢燃信号,在集中攻击下优于逐事件检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19235 2026-06-18 cs.CR 新提交 71%

CodeSentinel: A Three-Layer Defense Against Indirect Prompt Injection in Code Contexts

CodeSentinel:代码上下文中针对间接提示注入的三层防御

Po-Han Cheng, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

专题命中 提示注入 :prompt injection(title)

AI总结 针对代码大语言模型在检索外部代码时面临的间接提示注入攻击,提出CodeSentinel三层推理时净化器,结合语法引导预过滤、CST引导动态Min-K%评分和节点扰动分析,实现0.80节点级F1,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26269 2026-05-27 cs.CR 71%

AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents

AgentSecBench:测量LLM智能体中的提示注入、隐私泄露和工具使用完整性

Faruk Alpay, Taylan Alpay

专题命中 提示注入 :prompt injection(title)

AI总结 提出AgentSecBench框架,通过定义意图到执行的无干扰游戏,系统评估LLM智能体在指令完整性、检索机密性和能力完整性方面的安全风险,并实验验证防御措施的有效性。

Comments 24 pages, 3 figures. Ancillary files provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13471 2026-05-14 cs.CR 71%

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

睡眠通道与溯源门:始终在线自主AI代理中的持久提示注入

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title)

AI总结 研究提出睡眠通道概念,揭示始终在线AI代理中持久提示注入的机制,并通过层级防御方案和形式化证明提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19091 2024-10-11 cs.CR 71%

System-Level Defense against Indirect Prompt Injection Attacks: An Information Flow Control Perspective

Fangzhou Wu, Ethan Cecchetti, Chaowei Xiao

专题命中 提示注入 :prompt injection(title)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13574 2026-08-17 cs.AI cs.MA 新提交 70%

Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 70%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22024 2026-07-27 cs.CR cs.AI 新提交 70%

Agent Security Needs Redefinition through a Holistic Framework

通过整体框架重新定义智能体安全需求

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Chenguang Wang, Dawn Song

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究指出智能体安全是上下文问题,当前基于内容的框架有误。通过源授权、任务对齐、行动对齐和数据隔离四个属性实施上下文安全,改变了防御连贯性、评估有效性及可识别的攻击模式。

Comments ICML 2026 Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10712 2026-07-14 cs.CR cs.AI cs.DL 新提交 70%

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

分布式科学否认:人工智能系统的间接数据投毒如何使科学欺诈产业化

Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究探讨人工智能时代科学欺诈新形式,即间接数据投毒。对手 corrupt 开放数据集上传,使自主研究代理处理后传播欺诈。通过多话题、多系统实验发现投毒成功率高而检测率低。提出科学家角色和数据溯源审计措施,后者可有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29960 2026-06-30 cs.CL 70%

IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

IHDec:面向多轮指令层级安全性的散度引导对比解码

Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 针对多轮对话中指令层级失效问题,提出基于Jensen-Shannon散度的无训练对比解码方法IHDec,自动检测并抑制越级指令,优于训练基线且保持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新 70%

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19588 2026-06-19 cs.AI cs.CR cs.LO 新提交 70%

Analyzing the Narration Gap in LLM-Solver Loops

分析大语言模型-求解器循环中的叙述差距

Zunchen Huang, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究LLM与SAT/SMT求解器混合推理中,将求解器输出转化为用户答案的叙述步骤存在的安全漏洞,通过形式化建模和实验评估发现证书门控可保证求解结果正确,但对抗攻击可反转结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15656 2026-06-16 cs.AI 新提交 70%

Overcoming the Impedance Mismatch: A Theoretical Roadmap for Fusing Foundation Models and Knowledge Graphs

克服阻抗不匹配:融合基础模型与知识图谱的理论路线图

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出“阻抗不匹配”概念,形式化分析基础模型与知识图谱的结构与几何摩擦,通过三级层次分类揭示现有方法的局限,并给出理论路线图实现真正的语义融合。

Comments 12 pages. Accepted at the ACL 2026 4th Workshop on Towards Knowledgeable Foundation Models (https://openreview.net/forum?id=hXDYsNAq8m)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00991 2026-05-29 cs.AI cs.PL 70%

Tracking Capabilities for Safer Agents

更安全智能体的追踪能力

Martin Odersky, Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham

机构 * EPFL(苏黎世联邦理工学院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出通过Scala 3的捕获检查类型系统静态追踪能力,构建基于编程语言的智能体安全约束,防止信息泄露和恶意副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20704 2026-05-21 cs.CR cs.AI cs.MA 70%

Heartbeat-Bound Hierarchical Credentials: Cryptographic Revocation for AI Agent Swarms

基于心跳的分层凭证:面向AI代理群的加密撤销机制

Saurabh Deochake

机构 * SentinelOne Inc.(SentinelOne公司)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种基于心跳的分层凭证协议,通过将凭证有效性与周期性父级存活证明绑定,实现无需网络连接的高效凭证撤销,显著减少了僵尸代理的存活时间并提升了验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18918 2026-05-20 cs.CR cs.AI 70%

ESLD (External Surrogate Latent Defense): A Latent-Space Architecture for Faster, Stronger Prompt-Injection Defense

ESLD (外部代理潜在防御):一种用于更快、更强提示注入防御的潜在空间架构

Yash Narendra

机构 * Microsoft(微软)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种名为ESLD的潜在空间架构,通过利用守卫模型内部表示中的信号来加速安全检查并提高检测准确性,无需重新训练或修改守卫模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-05-12 cs.LG 70%

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 25 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22628 2026-05-04 cs.CR cs.AI 70%

Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts

Sentra-Guard:一种实时多语言对抗对抗性LLM提示的防御系统

Md. Mehedi Hasan, Sk Tanzir Mehedi, Ziaur Rahman, Rafid Mostafiz, Md. Abir Hossain

专题命中 提示注入 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Sentra-Guard通过混合架构和分类器-检索器融合模块,实时检测并缓解针对大语言模型的劫持和提示注入攻击,实现多语言鲁棒性与高检测率。

Comments 11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22888 2026-04-28 cs.CR cs.AI 70%

RouteGuard: Internal-Signal Detection of Skill Poisoning in LLM Agents

RouteGuard: LLM代理中技能中毒的内部信号检测

Wenjie Xiao, Xuehai Tang, Biyu Zhou, Songlin Hu, Jizhong Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出RouteGuard,通过响应条件注意力和隐藏状态对齐检测LLM代理中的技能中毒,实验证明其在真实和合成数据上表现优异,有效恢复被词法筛选遗漏的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 70%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22519 2026-04-01 cs.SE cs.AI cs.PL 70%

LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface

LLMON:一种面向大语言模型的标记语言,用于在大语言模型接口中利用结构和语义

Michael Hind, Basel Shbita, Bo Wu, Farhan Ahmed, Chad DeLuca, Nathan Fulton, David Cox, Dan Gutfreund

机构 * IBM Research(IBM研究院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 LLMON通过引入一种面向大语言模型的标记语言,使文本的结构和语义元数据能自然地传递给大语言模型,从而提升模型的准确性、安全性和稳定性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05066 2026-02-26 cs.CR cs.AI 70%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏