Defense against Prompt Injection Attacks via Mixture of Encodings
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.CL
专题命中 提示注入 :safety(title,abstract);alignment(abstract);分类 cs.LG
Comments NeurIPS'24
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf
Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 18 Pages, 8 Figures, 5 Tables, Keywords: Attack Defending, Security, Prompt Injection, Backdoor Attacks, Adversarial Attacks, Prompt Trigger Attacks
在指令阶梯上推理以实现可控语言模型
机构 * Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) ; Microsoft Research(微软研究院) ; Allen Institute for AI(艾伦人工智能研究所)
专题命中 提示注入 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 通过将指令层级解析重构为推理任务,并构建VerIH数据集进行轻量级强化学习,使模型能优先处理高层级指令,在冲突场景下提升约20%的指令遵循准确率,并增强对越狱和提示注入的鲁棒性。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 39332-39354
镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)
AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。
LLM智能体中针对提示注入的带外防御的自适应评估
机构 * LaunchSafe Research(LaunchSafe研究院)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。
Comments 12 pages, 5 figures, 4 tables
ProjGuard:通过低维投影实现计算机使用代理的安全监控
专题命中 提示注入 :safety(title,abstract);prompt injection(abstract)
AI总结 ProjGuard通过行为轨迹监控实现计算机使用代理的安全防护,利用轻量级风险信号提前预警潜在危险,结合辅助视觉语言模型进行针对性修正,提升任务完成率并降低安全风险。
Comments The manuscript was submitted under an inappropriate category. In addition, substantial updates and improvements are currently being made to the document. To avoid confusion and ensure that readers access the most accurate version of the work, we request withdrawal of the current manuscript
测量基于LLM的简历筛选中真实世界的提示注入攻击
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Duke University(杜克大学) ; Arizona State University(亚利桑那州立大学) ; hireEZ ; University of California, Berkeley(加州大学伯克利分校)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。
Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement
提示控制流完整性:一种优先级感知的运行时防御,用于对抗LLM系统中的提示注入
专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract)
AI总结 本文提出Prompt Control-Flow Integrity,一种优先级感知的运行时防御机制,通过结构化组合系统、开发者、用户和检索文档片段来防范提示注入攻击,实现零误报率和低开销。
Comments 4 Figures, 3 Tables, Submitted to the International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure 2026
大语言模型排序器对提示注入攻击的脆弱性
专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract)
AI总结 本文研究了大语言模型排序器对提示注入攻击的脆弱性,通过实验证明不同架构和设置下的攻击效果,并揭示了编码器-解码器架构的抗性。
Comments 18 pages, 7 figures
AegisAgent:一种对抗LLM-HAR中提示注入攻击的自主防御代理
专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract)
AI总结 AegisAgent通过自主推理和验证机制,有效降低LLM-HAR系统中提示注入攻击的成功率,提升系统安全性。
ARGUS: 通过引导指令遵循行为防御多模态间接提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)
AI总结 ARGUS通过引导指令遵循行为,在表示空间中寻找最优防御方向,实现对多模态间接提示注入攻击的有效防御,同时保持模型性能。
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments The code is available at https://github.com/sleeepeer/PISanitizer
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in USENIX Security Symposium 2024; the model sizes for closed-source models are from blog posts. For slides, see https://people.duke.edu/~zg70/code/PromptInjection.pdf
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments PING results in Table 2 updated (bug fixed)
防御检索增强型入侵检测系统免受知识投毒与提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。
Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
提示注入作为角色混淆
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过角色探测和CoT伪造攻击,揭示提示注入源于LLM对文本来源的角色感知混淆,并提出角色混淆程度可预测攻击成功率。
Comments ICML 2026
超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统
机构 * Saint Petersburg State University(圣彼得堡国立大学)
专题命中 提示注入 :safety(title);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。
从提示注入到持久控制:防御智能体框架中的木马后门
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ClawTrojan基准测试揭示本地智能体框架中的多步木马攻击,并设计DASGuard防御方法,通过扫描控制文本、追溯来源并清除不可信控制内容,实现动态防御。
Comments Code and data are available at https://github.com/RUC-NLPIR/ClawTrojan
工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性
机构 * Department of Computer Science(计算机科学系) ; AI and Media Analysis Lab(人工智能与媒体分析实验室) ; Berlin, Germany(柏林,德国)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。
Comments 17 pages, 16 figures
MIPIAD: 多语言间接提示注入攻击防御与Qwen-TF-IDF混合及元集成学习
机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出MIPIAD框架,结合Qwen2.5-1.5B微调序列分类器、TF-IDF特征和元集成学习,通过合成基准测试在英文和孟加拉文上实现高准确率的攻击检测,有效减少跨语言差距。
语义作为盾牌:对抗大语言模型情感分类中提示注入的标签伪装防御(LDD)
机构 * Department of Computer Science, George Washington University(计算机科学系,乔治华盛顿大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出LDD,一种通过语义伪装标签来防御大语言模型情感分类中提示注入攻击的方法,展示了其在不同模型上的有效性。