Defending Against Prompt Injection With a Few DefensiveTokens
专题命中 提示注入 :prompt injection(title,abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 提示注入 :prompt injection(title,abstract)
专题命中 提示注入 :prompt injection(title,abstract)
Comments ACM CODASPY 2025; extended technical report
专题命中 提示注入 :prompt injection(title,abstract)
Comments 12 pages, 3 figures, 3 tables, 5 listings. 47th IEEE/ACM International Conference on Software Engineering (2025)
专题命中 提示注入 :prompt injection(title,abstract)
通道卫士:安全模型无法组合成安全的多智能体系统
机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) ; Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) ; Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) ; Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)
专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。
GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰
机构 * SAIS, UCAS(中国科学院大学人工智能学院) ; SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)
专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL
AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。
Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection
CachePrune: 通过KV缓存编辑教LLMs不遵循指令
机构 * Adobe Research(Adobe研究院) ; University of California San Diego(加州大学圣地亚哥分校) ; University of New South Wales(新南威尔士大学)
专题命中 提示注入 :DPO(abstract,abstract_cn);prompt injection(abstract);分类 cs.AI
AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。
一个形式化大语言模型代理安全性的框架
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; UC Berkeley(加州大学伯克利分校) ; Duke University(杜克大学)
专题命中 提示注入 :alignment(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本文提出一个框架,从情境安全角度系统化现有攻击与防御,定义四个安全属性并引入Oracle函数验证,重新定义攻击和防御,为未来研究提供方向。
VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击
机构 * University of Science and Technology of China(中国科学技术大学) ; North Automatic Control Technology Research Institute(北自动控制技术研究所)
专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。
专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI
Comments Pre-print
谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; ST Engineering, Singapore(ST工程,新加坡) ; IBM Research, USA(IBM研究院,美国) ; University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)
专题命中 提示注入 :prompt injection(title);分类 cs.AI、cs.CY
AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。
Comments 25 pages
MIRAGE:通过用户生成内容对移动GUI代理的上下文感知提示注入
机构 * Griffith University(格里菲斯大学) ; Quantstamp ; Nanyang Technological University(南洋理工大学) ; Singapore Management University(新加坡管理学院) ; University of New South Wales(新南威尔士大学) ; Wake Forest University(威克森林大学) ; Independent Researcher(独立研究者)
专题命中 提示注入 :prompt injection(title);分类 cs.CL、cs.AI
AI总结 提出MIRAGE管道,通过将攻击者控制的文本嵌入用户生成内容区域,在不修改代理、应用或操作系统的情况下,对视觉语言模型驱动的移动GUI代理实现高成功率的提示注入攻击。
ChatGPT: 优秀论文!接受它。编辑:冒名顶替者发现!审稿被拒
专题命中 提示注入 :safety(abstract);jailbreak(abstract);prompt injection(abstract)
AI总结 本文探讨了LLM在科学论文写作与审稿中的风险,提出通过隐式提示注入技术攻击和防御LLM审稿的漏洞,旨在增强同行评审过程的可靠性。
IH-Challenge: 一个改进前沿大语言模型指令层级的训练数据集
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 IH-Challenge通过强化学习训练数据集提升前沿大语言模型在指令冲突中的鲁棒性,减少不安全行为并提高帮助性。
生成价值冲突揭示大语言模型优先级
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
专题命中 提示注入 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 生成价值冲突揭示大语言模型优先级,通过ConflictScope评估模型在价值冲突中的优先级,发现模型在开放式设置中更支持个人价值,系统提示能提高对齐效果14%。
Comments Accepted to ICLR 2026 (the 14th International Conference on Learning Representations)
面向代理计算的安全基础
专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract)
AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。
SkillJect:有效自动化基于技能的提示注入以针对具备技能的代理
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Chongqing University, China(重庆大学) ; Northeastern University, China(东北大学) ; Sun Yat-sen University, China(中山大学) ; University of Oxford, UK(牛津大学)
专题命中 提示注入 :prompt injection(title);分类 cs.AI
AI总结 SkillJect 是首个自动化生成有效中毒技能的框架,通过隐藏恶意负载和重写指令通道,提升攻击效果,揭示可重用技能生态中的持久性攻击向量。
对大型语言模型中提示注入防御措施的评估
机构 * Swept AI ; University of Michigan(密歇根大学)
专题命中 提示注入 :prompt injection(title);分类 cs.AI
AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。
Comments 14 pages, 9 figures
共识生成应用在数字民主中的提示注入漏洞
专题命中 提示注入 :prompt injection(title);分类 cs.CY
AI总结 研究揭示了共识生成LLMs在数字民主中的提示注入漏洞,并提出鲁棒性方法以减少方向性失败。
Comments 33 pages, 11 figures, 11 tables
从提示注入到协议利用:LLM驱动的AI代理工作流中的威胁
机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(阿联酋大学计算机与网络工程系) ; Technology Innovation Institute(技术创新研究所) ; Eötvös Loránd University(埃奥瓦大学) ; Department of Computer Science, Guelma University(古尔马大学计算机科学系) ; De Montfort University(德蒙福特大学) ; Khalifa University of Science and Technology(卡里玛科学技术大学)
专题命中 提示注入 :prompt injection(title);分类 cs.AI
AI总结 本文提出了一种统一的端到端威胁模型,系统分类了LLM代理生态系统中的三十多种攻击技术,涵盖输入操纵、模型妥协、系统和隐私攻击及协议漏洞,并提供缓解策略以设计安全的代理AI系统。
Comments The paper is published in ICT Express (Elsevier)
Chameleon:基于尺度的视觉提示注入的自适应对抗代理
专题命中 提示注入 :prompt injection(title);分类 cs.AI
AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。
Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing
机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学计算机科学与技术系对话式人工智能小组)
专题命中 提示注入 :prompt injection(title);分类 cs.CL
专题命中 提示注入 :prompt injection(title);分类 cs.CL
遵循规范:考量微调与提示对模型理由的影响
专题命中 提示注入 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
AI总结 该研究将AI视为代理主体,通过对LLaMA-3.2-11B等三个模型开展实验,发现违反规范的微调会改变模型的理由风格,而系统提示可覆盖该行为,支持对齐的分布式观点,为可争议监督提供了相关依据。
Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026
面包屑式搜索智能体
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM搜索智能体的安全问题,提出ACH和TGSE策略,通过操纵搜索结果形成连贯证据链,大幅提升攻击成功率。
Comments 38 pages, 7 figures
论共享嵌入序列模型中指令与数据的不可分离性
机构 * Independent Researcher(独立研究员)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文证明在共享嵌入架构中,由于缺乏强制控制-数据分离,完美防御提示注入在数学上是不可能的,并提出了语义忠实控制(SFC)的概念,通过三个理论结果揭示了其根本原因,类比冯·诺依曼架构的代码-数据混淆问题。
Comments 18 pages, 1 figure, 2 tables
过度激进的编码代理:在良性任务中测量超出范围的动作
机构 * Griffith University(格里菲斯大学) ; Wake Forest University(威克森林大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Quantstamp
专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。
基于神经拍卖的大型语言模型广告
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。
Comments 17 pages, 9 figures, including appendices
对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体
机构 * Pace University(帕克大学)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。
Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026
自回归语言模型中的上下文依赖性与可靠性
机构 * Department of Informatics, University of Oslo(信息学院,奥斯陆大学) ; Department of Electronic Systems, Aalborg University(电子系统系,奥胡斯大学)
专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RISE方法,用于自回归语言模型中区分关键上下文元素与冗余信息,提升解释的可靠性和稳定性。