arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2507.07974 2025-08-26 cs.CR 78%

Defending Against Prompt Injection With a Few DefensiveTokens

Sizhe Chen, Yizhu Wang, Nicholas Carlini, Chawin Sitawarin, David Wagner

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15145 2025-04-15 cs.CR 78%

PromptShield: Deployable Detection for Prompt Injection Attacks

Dennis Jacob, Hend Alzahrani, Zhanhao Hu, Basel Alomair, David Wagner

专题命中 提示注入 :prompt injection(title,abstract)

Comments ACM CODASPY 2025; extended technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01990 2025-01-29 cs.CR 78%

From Prompt Injections to SQL Injection Attacks: How Protected is Your LLM-Integrated Web Application?

Rodrigo Pedro, Daniel Castro, Paulo Carreira, Nuno Santos

专题命中 提示注入 :prompt injection(title,abstract)

Comments 12 pages, 3 figures, 3 tables, 5 listings. 47th IEEE/ACM International Conference on Software Engineering (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08833 2023-06-16 cs.HC 78%

Safeguarding Crowdsourcing Surveys from ChatGPT with Prompt Injection

Chaofan Wang, Samuel Kernan Freire, Mo Zhang, Jing Wei, Jorge Goncalves, Vassilis Kostakos, Zhanna Sarsenbayeva, Christina Schneegass, Alessandro Bozzon, Evangelos Niforatos

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19430 2026-08-11 cs.CR cs.AI cs.MA 版本更新 77%

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

通道卫士:安全模型无法组合成安全的多智能体系统

Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新 77%

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI 77%

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

专题命中 提示注入 :DPO(abstract,abstract_cn);prompt injection(abstract);分类 cs.AI

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19469 2026-03-23 cs.CR cs.AI 77%

A Framework for Formalizing LLM Agent Security

一个形式化大语言模型代理安全性的框架

Vincent Siu, Jingxuan He, Kyle Montgomery, Zhun Wang, Neil Gong, Chenguang Wang, Dawn Song

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) Duke University(杜克大学)

专题命中 提示注入 :alignment(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出一个框架,从情境安全角度系统化现有攻击与防御,定义四个安全属性并引入Oracle函数验证,重新定义攻击和防御,为未来研究提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 77%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17155 2025-08-26 cs.CR cs.AI 77%

Mind the Gap: Time-of-Check to Time-of-Use Vulnerabilities in LLM-Enabled Agents

Derek Lilienthal, Sanghyun Hong

专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 76%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 提示注入 :prompt injection(title);分类 cs.AI、cs.CY

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28116 2026-05-28 cs.CR cs.AI cs.CL 76%

MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content

MIRAGE:通过用户生成内容对移动GUI代理的上下文感知提示注入

Ruoqi Guo, Yi Liu, Gelei Deng, Yiheng Xiong, Yuekang Li, Ying Zhang, Leo Yu Zhang, Lida Zhao, Ji Jie, Yuxiao Lu

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) University of New South Wales(新南威尔士大学) Wake Forest University(威克森林大学) Independent Researcher(独立研究者)

专题命中 提示注入 :prompt injection(title);分类 cs.CL、cs.AI

AI总结 提出MIRAGE管道,通过将攻击者控制的文本嵌入用户生成内容区域,在不修改代理、应用或操作系统的情况下,对视觉语言模型驱动的移动GUI代理实现高成功率的提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20405 2026-04-16 cs.CR 75%

ChatGPT: Excellent Paper! Accept It. Editor: Imposter Found! Review Rejected

ChatGPT: 优秀论文!接受它。编辑:冒名顶替者发现!审稿被拒

Kanchon Gharami, Sanjiv Kumar Sarkar, Safayat Bin Hakim, Yongxin Liu, Nahid Farhady Ghalaty, Shafika Showkat Moni

专题命中 提示注入 :safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文探讨了LLM在科学论文写作与审稿中的风险,提出通过隐式提示注入技术攻击和防御LLM审稿的漏洞,旨在增强同行评审过程的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10521 2026-03-12 cs.AI cs.CL cs.CR cs.LG 75%

IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs

IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集

Chuan Guo, Juan Felipe Ceron Uribe, Sicheng Zhu, Christopher A. Choquette-Choo, Steph Lin, Nikhil Kandpal, Milad Nasr, Rai, Sam Toyer, Miles Wang, Yaodong Yu, Alex Beutel, Kai Xiao

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25369 2026-02-27 cs.CL cs.AI cs.LG 75%

Generative Value Conflicts Reveal LLM Priorities

生成价值冲突揭示大语言模型优先级

Andy Liu, Kshitish Ghate, Mona Diab, Daniel Fried, Atoosa Kasirzadeh, Max Kleiman-Weiner

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 提示注入 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 生成价值冲突揭示大语言模型优先级,通过ConflictScope评估模型在价值冲突中的优先级,发现模型在开放式设置中更支持个人价值,系统提示能提高对齐效果14%。

Comments Accepted to ICLR 2026 (the 14th International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01295 2026-02-20 cs.CR 75%

Systems Security Foundations for Agentic Computing

面向代理计算的安全基础

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract)

AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14211 2026-06-17 cs.CR cs.AI 版本更新 74%

SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents

SkillJect:有效自动化基于技能的提示注入以针对具备技能的代理

Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) University of Oxford, UK(牛津大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 SkillJect 是首个自动化生成有效中毒技能的框架,通过隐藏恶意负载和重写指令通道,提升攻击效果,揭示可重用技能生态中的持久性攻击向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23887 2026-05-14 cs.CR cs.AI 74%

Evaluation of Prompt Injection Defenses in Large Language Models

对大型语言模型中提示注入防御措施的评估

Priyal Deep, Shane Emmons, Amy Fox, Kyle Bacon, Kelley McAllister, Peter Ortiz, Krisztian Flautner

机构 * Swept AI University of Michigan(密歇根大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04281 2026-03-03 cs.CY cs.CR 74%

Prompt Injection Vulnerability of Consensus Generating Applications in Digital Democracy

共识生成应用在数字民主中的提示注入漏洞

Jairo Gudiño-Rosero, Clément Contet, Umberto Grandi, César A. Hidalgo

专题命中 提示注入 :prompt injection(title);分类 cs.CY

AI总结 研究揭示了共识生成LLMs在数字民主中的提示注入漏洞,并提出鲁棒性方法以减少方向性失败。

Comments 33 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23260 2025-12-16 cs.CR cs.AI 74%

From Prompt Injections to Protocol Exploits: Threats in LLM-Powered AI Agents Workflows

从提示注入到协议利用:LLM驱动的AI代理工作流中的威胁

Mohamed Amine Ferrag, Norbert Tihanyi, Djallel Hamouda, Leandros Maglaras, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(阿联酋大学计算机与网络工程系) Technology Innovation Institute(技术创新研究所) Eötvös Loránd University(埃奥瓦大学) Department of Computer Science, Guelma University(古尔马大学计算机科学系) De Montfort University(德蒙福特大学) Khalifa University of Science and Technology(卡里玛科学技术大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 本文提出了一种统一的端到端威胁模型,系统分类了LLM代理生态系统中的三十多种攻击技术,涵盖输入操纵、模型妥协、系统和隐私攻击及协议漏洞,并提供缓解策略以设计安全的代理AI系统。

Comments The paper is published in ICT Express (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04895 2025-12-05 cs.AI cs.MA 74%

Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems

Chameleon:基于尺度的视觉提示注入的自适应对抗代理

M Zeeshan, Saud Satti

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。

Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01287 2025-11-04 cs.CL cs.CR 74%

"Give a Positive Review Only": An Early Investigation Into In-Paper Prompt Injection Attacks and Defenses for AI Reviewers

Qin Zhou, Zhexin Zhang, Zhi Li, Limin Sun

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学计算机科学与技术系对话式人工智能小组)

专题命中 提示注入 :prompt injection(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14048 2025-02-25 cs.CL 74%

Prompt Injection Attacks in Defended Systems

Daniil Khomsky, Narek Maloyan, Bulat Nutfullin

专题命中 提示注入 :prompt injection(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13250 2026-08-14 cs.CY cs.AI 新提交 73%

Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

遵循规范:考量微调与提示对模型理由的影响

Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du, Ali Sunyaev

专题命中 提示注入 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究将AI视为代理主体,通过对LLaMA-3.2-11B等三个模型开展实验,发现违反规范的微调会改变模型的理由风格,而系统提示可覆盖该行为,支持对齐的分布式观点,为可争议监督提供了相关依据。

Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04565 2026-08-06 cs.CR cs.AI cs.CL 新提交 73%

Breadcrumbing Search Agents

面包屑式搜索智能体

Xuebin Li, Hanqing Zhao, Siyuan Liang, Kejiang Chen, Weiming Zhang, Dacheng Tao, Nenghai Yu

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27567 2026-06-29 cs.CR cs.AI cs.LG 新提交 73%

On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models

论共享嵌入序列模型中指令与数据的不可分离性

Dewank Pant, Shruti Lohani, Avijit Kumar

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。

Comments 18 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18583 2026-05-19 cs.SE cs.AI cs.CL cs.CR 73%

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

过度激进的编码代理:在良性任务中测量超出范围的动作

Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu

机构 * Griffith University(格里菲斯大学) Wake Forest University(威克森林大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Quantstamp

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08326 2026-05-12 cs.LG cs.AI 73%

LLM Advertisement based on Neuron Auctions

基于神经拍卖的大型语言模型广告

Peiran Yun, Wenxin Xu, Jiayuan Liu, Yihang Zhang, Liang Zeng, Lingkai Kong, Tonghan Wang

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。

Comments 17 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08257 2026-05-12 cs.CR cs.AI cs.LG 73%

Research on Security Enhancement Methods for Adversarial Robust Large Language Model Intelligent Agents for Medical Decision-Making Tasks

对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体

Saisai Hu

机构 * Pace University(帕克大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。

Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01378 2026-02-03 cs.CL cs.AI stat.ML 73%

Context Dependence and Reliability in Autoregressive Language Models

自回归语言模型中的上下文依赖性与可靠性

Poushali Sengupta, Shashi Raj Pandey, Sabita Maharjan, Frank Eliassen

机构 * Department of Informatics, University of Oslo(信息学院,奥斯陆大学) Department of Electronic Systems, Aalborg University(电子系统系,奥胡斯大学)

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RISE方法,用于自回归语言模型中区分关键上下文元素与冗余信息,提升解释的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏