arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2605.17324 2026-05-19 cs.CR cs.AI 79%

ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents

ASPI:寻求澄清会放大LLM代理中的提示注入漏洞

Udari Madhushani Sehwag, Zhengyang Shan, Heming Liu, Dileepa Lakshan, Joseph Brandifino, Max Fenkell

机构 * Scale AI Boston University(波士顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Human Frontier Collective(人类前沿集体)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 该研究探讨了LLM代理在执行任务时寻求澄清的行为对提示注入攻击的影响,发现这种行为会显著增加代理的脆弱性,并提出了ASPI基准测试来评估这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15030 2026-05-15 cs.CR cs.AI 79%

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

WARD: 用于对抗Web代理对抗提示注入的鲁棒防御

Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of Science(科学大学) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 WARD通过WARD-Base和WARD-PIG数据集及A3T框架,实现高效鲁棒的Web代理防御,有效应对提示注入攻击,保持低误报率和高效运行。

Comments Code and models: https://github.com/caothientri2001vn/WARD-WebAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25926 2026-05-12 cs.CR cs.LG 79%

Preventing Prompt Injection with Type-Directed Privilege Separation

通过类型引导的特权分离防止提示注入

Dennis Jacob, Emad Alghamdi, Zhanhao Hu, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。

Comments Revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI 79%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17125 2026-04-21 cs.CR cs.AI 79%

CASCADE: A Cascaded Hybrid Defense Architecture for Prompt Injection Detection in MCP-Based Systems

CASCADE:一种用于MCP系统中提示注入检测的级联混合防御架构

İpek Abasıkeleş Turgut, Edip Gümüş

机构 * Department of Computer Engineering, Faculty of Engineering and Natural Sciences(工程与自然科学学院计算机工程系) Department of Computer Engineering, Institute of Graduate Studies(研究生院计算机工程系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出CASCADE架构,通过三级级联机制提升MCP系统中提示注入检测的精度与召回率,实现高检测率与低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03793 2026-04-21 cs.CL cs.CR 79%

AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption

AttnTrace: 基于提示注入和知识腐败的上下文归因

Yanting Wang, Runpeng Geng, Ying Chen, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出AttnTrace,一种基于LLM对提示生成的注意力权重的上下文追溯方法,通过增强效果和技术改进,提高了准确性和效率,并展示了其在检测长上下文中的提示注入应用。

Comments To appear in IEEE S&P 2026. The code is available at https://github.com/Wang-Yanting/AttnTrace. The demo is available at https://huggingface.co/spaces/SecureLLMSys/AttnTrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14604 2026-04-17 cs.CR cs.AI cs.SD 79%

Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection

通过上下文无关且不可察觉的音频提示注入劫持大型音频-语言模型

Meng Chen, Kun Wang, Li Lu, Jiaheng Zhang, Tianwei Zhang

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出AudioHijack框架,通过生成不可察觉的对抗性音频劫持LALMs,实验显示在6种恶意行为中平均成功率达79%-96%。

Comments Accepted by IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22830 2026-04-14 cs.CL 79%

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

ChatInject: 利用聊天模板对LLM代理进行提示注入

Hwan Chang, Yonghyun Jun, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 研究提出ChatInject攻击,通过模拟聊天模板诱导LLM代理执行恶意指令,实验显示其攻击成功率显著高于传统方法,且现有防御措施对多轮对话变种效果有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06436 2026-04-14 cs.CR cs.AI 79%

The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?

防御三重困境:为何提示注入防御包装失效?

Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Joel Webb, Blake Gatto, Md Tamjidul Hoque

机构 * OWASP Amazon Leo UNO Amazon Web Services(亚马逊云服务) Cisco(思科) Shrewd Security

专题命中 提示注入 :prompt injection(title);alignment(abstract);分类 cs.AI

AI总结 研究证明连续且保持效用的防御包装无法使语言模型的所有输出严格安全,并揭示了防御必须失败的精确位置。通过三个逐步加强的假设,证明了连续性、效用保持性和完整性无法共存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04666 2026-04-10 cs.AI cs.CR 79%

Know Thy Enemy: Securing LLMs Against Prompt Injection via Diverse Data Synthesis and Instruction-Level Chain-of-Thought Learning

知彼者智:通过多样化数据合成和指令级推理学习增强大语言模型抗提示注入能力

Zhiyuan Chang, Mingyang Li, Yuekai Huang, Ziyou Jiang, Xiaojun Jia, Qian Xiong, Junjie Wang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory, Institute of Software Chinese Academy of Sciences(中国科学院软件研究所综合信息系统技术国家级重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Beijing Forestry University(北京林业大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出InstruCoT方法,通过多样化数据合成和指令级推理学习提升大语言模型对提示注入攻击的防御能力,实验表明其在行为偏差、隐私泄露和有害输出方面显著优于基线方法。

Comments 19 pages, 6 figures; accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00750 2026-04-02 cs.CR cs.AI 79%

Bypassing Prompt Injection Detectors through Evasive Injections

通过规避性注入绕过提示注入检测器

Md Jahedur Rahman, Ihsen Alouani

机构 * Centre for Secure Information Technologies(安全信息技术中心) Queen's University Belfast(贝尔法斯特女王大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出了一种多探针规避攻击,通过优化后缀同时欺骗所有层间漂移检测器,实验显示其在Phi-3和Llama-3上成功绕过检测器的高成功率,提出基于对抗后缀增强的防御方法。

Comments This paper is to appear at ICNNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30016 2026-04-01 cs.CR cs.AI 79%

Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks

构建安全的AI代理:系统级防御间接提示注入攻击的视角

Chong Xiang, Drew Zagieboylo, Shaona Ghosh, Sanjay Kariyappa, Kai Greshake, Hanshen Xiao, Chaowei Xiao, G. Edward Suh

机构 * NVIDIA(英伟达) Independent Researcher(独立研究员) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文探讨了针对间接提示注入攻击的系统级防御策略,提出动态重计划、安全策略更新及人类交互在代理设计中的重要性,同时指出现有基准的局限性及系统级防御的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23791 2026-03-26 cs.CR cs.AI 79%

The Cognitive Firewall:Securing Browser Based AI Agents Against Indirect Prompt Injection Via Hybrid Edge Cloud Defense

认知防火墙:通过混合边缘云防御保护基于浏览器的AI代理免受间接提示注入攻击

Qianlong Lan, Anuj Kaul

机构 * eBay Inc(eBay公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出认知防火墙,通过混合边缘云防御机制,有效降低基于浏览器的AI代理遭受间接提示注入攻击的成功率,同时显著提升系统响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13424 2026-03-17 cs.CR cs.AI 79%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03637 2026-03-05 cs.CV cs.AI cs.CR 79%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02456 2026-03-03 cs.AI cs.CR 79%

VPI-Bench: Visual Prompt Injection Attacks for Computer-Use Agents

VPI-Bench:用于计算机使用代理的视觉提示注入攻击

Tri Cao, Bennett Lim, Yue Liu, Yuan Sui, Yuexin Li, Shumin Deng, Lin Lu, Nay Oo, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(国立新加坡大学) Cyber Emerging Tech and R&D Co(网络安全与研发公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出VPI-Bench基准,用于评估计算机使用代理和浏览器使用代理在视觉提示注入攻击下的鲁棒性,发现当前代理在某些平台上被欺骗率达51%和100%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 79%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20720 2026-02-25 cs.CR cs.AI 79%

AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs

AdapTools: 面向代理LLM的自适应工具间接提示注入攻击

Che Wang, Jiaming Zhang, Ziqi Zhang, Zijie Wang, Yinghui Wang, Jianbo Gao, Tao Wei, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 79%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10453 2026-02-12 cs.CR cs.CL 79%

The Landscape of Prompt Injection Threats in LLM Agents: From Taxonomy to Analysis

大语言模型代理中提示注入威胁的图景:从分类到分析

Peiran Wang, Xinfeng Li, Chong Xiang, Jinghuai Zhang, Ying Li, Lixia Zhang, Xiaofeng Wang, Yuan Tian

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型代理中提示注入威胁的分类与分析,提出AgentPI基准以评估依赖上下文交互的代理行为,揭示现有防御的局限性并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09625 2026-02-11 cs.CR cs.AI 79%

The Promptware Kill Chain: How Prompt Injections Gradually Evolved Into a Multistep Malware Delivery Mechanism

提示武器杀链:提示注入如何逐渐演变成多步骤恶意软件交付机制

Oleg Brodt, Elad Feldman, Bruce Schneier, Ben Nassi

机构 * Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev(本·古里安大学软件与信息系统工程系) School of Electrical and Computer Engineering, Tel Aviv University(特拉维夫大学电气与计算机工程学院) Harvard Kennedy School, Harvard University, and Munk School, University of Toronto(哈佛大学哈佛肯尼迪学校及多伦多大学穆克学校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出提示武器杀链模型,揭示提示注入演变为多步骤恶意软件攻击机制的过程,并提出针对各阶段的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07918 2026-02-10 cs.CR cs.LG stat.ME 79%

CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution

CausalArmor: 通过因果归因实现高效的间接提示注入防护

Minbeom Kim, Mihir Parmar, Phillip Wallis, Lesly Miculicich, Kyomin Jung, Krishnamurthy Dj Dvijotham, Long T. Le, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Google Deepmind(谷歌DeepMind) Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 CausalArmor通过因果归因实现高效间接提示注入防护,提升AI代理的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07104 2026-02-10 cs.CV cs.AI 79%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02735 2026-02-09 cs.CR cs.AI 79%

Meta SecAlign: A Secure Foundation LLM Against Prompt Injection Attacks

Meta SecAlign: 一种针对提示注入攻击的 secure LLM 基础

Sizhe Chen, Arman Zharmagambetov, David Wagner, Chuan Guo

机构 * FAIR at Meta(Meta 的 FAIR 部门) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 Meta SecAlign 是首个开源的 LLM,具备内置的模型级防御,实现了商业级性能,且在复杂代理任务中表现优异,同时在提示注入攻击中展现出更高的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17549 2026-01-27 cs.CR cs.AI 79%

Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents

打破协议:模型上下文协议规范的安全分析及工具集成LLM代理中的提示注入漏洞

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文分析了模型上下文协议的安全漏洞,提出MCPSec协议扩展以提升安全性,减少攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17383 2026-01-27 cs.CV cs.AI 79%

Physical Prompt Injection Attacks on Large Vision-Language Models

针对大视觉-语言模型的物理提示注入攻击

Chen Ling, Kai Hu, Hangcheng Liu, Xingshuo Han, Tianwei Zhang, Changhai Ou

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究提出了一种无需访问模型或输入的物理提示注入攻击方法,通过物理物体注入恶意指令,成功攻击多种大视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14005 2026-01-27 cs.CR cs.LG 79%

PIShield: Detecting Prompt Injection Attacks via Intrinsic LLM Features

PIShield: 通过内在LLM特性检测提示注入攻击

Wei Zou, Yupei Liu, Yanting Wang, Ying Chen, Neil Gong, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 PIShield通过利用指令微调LLM的内部表示,高效检测提示注入攻击,显著优于现有方法。

Comments The code is available at https://github.com/weizou52/PIShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 79%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07072 2026-01-13 cs.CR cs.AI 79%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏