Robust Context-Aware Detection of Malicious Instructions in Text
文本中恶意指令的鲁棒上下文感知检测
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
文本中恶意指令的鲁棒上下文感知检测
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。
关系先验作为基于大语言模型的多智能体系统中的收敛压力
专题命中 提示注入 :alignment(abstract);分类 cs.CL
AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。
你的智能体大模型会秘密编码间接提示注入暴露的潜在信号
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用
Comments Preprint
基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。
推理时的指令层级调控
专题命中 提示注入 :safety(abstract);分类 cs.CL
AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。
Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures
智能云诱饵:一种用于自主入侵调查的欺骗驱动框架
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。
你还是我授权的那个智能体吗?在固定上限下演化智能体的获得性权限
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究长期存在的人工智能智能体部署后演化引发的授权问题,提出状态边界模型阐述授权连续性,通过固定过渡包络和效果上限,区分请求与实现效果,证明突变不会超上限,还映射了六种突变类别的授权后果。
SkillSieve:一种用于检测恶意AI代理技能的分层分流框架
机构 * Department of Earth Science and Engineering(地球科学与工程系) ; Imperial College London(帝国理工学院伦敦分校) ; Department of Computer Science(计算机科学系) ; University College London(伦敦大学学院) ; Lingban Technology Co., Ltd.(灵伴科技有限公司) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。
Comments 10 pages, 2 figures, 6 tables
孪生智能体:用于特权分离智能体的上下文残差压缩
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Chicago(芝加哥大学) ; University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL
AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。
ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击
机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) ; Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) ; Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。
可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试
机构 * Texas Tech University(德克萨斯技术大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。
PARSE: 面向专业领域LLM Agent的溯源感知检索净化
机构 * Data Science Institute(数据科学研究所)
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL
AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。
Comments 8 pages, 3 figures, 2 tables
针对多跳检索增强生成智能体的显著性诱导:威胁与防御
机构 * National University of Defense Technology(国防科技大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL
AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。
Comments 18 pages, 4 figures, 12 tables
智能体如何请求许可:人工智能智能体的用户权限,从接口到执行
机构 * University of Washington(华盛顿大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究人工智能智能体系统中用户级权限处理问题,通过调查21个提案构建分类法,分析五个商业智能体并与文献系统比较,确定主题与空白,为智能体权限系统研究提供参考。
Comments 15 pages, 4 figures
重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反
机构 * Sensifai BV(Sensifai公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。
Comments 42 pages, 5 Tables, 21 references
面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。
视觉 inception:通过多模态记忆污染在代理推荐系统中妥协长期规划
机构 * City University of Hong Kong(香港城市大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出视觉 inception 攻击,通过污染用户上传的图片在代理推荐系统中影响长期规划,提出 CognitiveGuard 防御框架以降低攻击风险。
Comments 17 pages, 6 figures, 16 tables
Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 20846-20862, 2026
LLMlambda 计算:人工智能代理、对话与信息流
机构 * University of Nottingham, UK(诺丁汉大学) ; University of Edinburgh, UK(爱丁堡大学) ; Chalmers University of Technology(查尔姆斯理工大学) ; The University of Gothenburg, Sweden(哥德堡大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。
具备安全保证的Web智能体不可信内容掩码技术
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; ISTA(瑞士信息科学与技术学院) ; Anthropic(Anthropic公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。
智能体数据注入攻击对人工智能智能体构成现实威胁
机构 * Seoul National University(首尔国立大学) ; Largosoft ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。
Comments 19 pages, 19 figures, 7 tables
用于智能体控制的生物基序
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。
Comments 80 pages. Preprint; feedback welcome
当代码遇见自然语言:基于分类法的LLM集成应用信息流分析
机构 * University of New South Wales(新南威尔士大学) ; Macquarie University(麦考瑞大学) ; National University of Singapore(新加坡国立大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出一种基于定量信息流理论的分类法,定义24个标签以跨越LLM调用的自然语言与编程语言边界,实现信息流分析,并在污点传播和程序切片中验证有效性。
这是一个陷阱!面向网络代理的任务重定向说服基准
机构 * University of Cambridge(剑桥大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。
Comments ICML 2026
通过计算机系统视角理解与评估爪类智能体安全性
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; KACST(阿卜杜勒阿齐兹国王科技城) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; NVIDIA(英伟达) ; Google DeepMind(谷歌DeepMind) ; UW Seattle(华盛顿大学西雅图分校) ; HUMAIN(胡迈因研究所)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。
代理安全遇上监管现实——受监管金融系统中自主代理威胁与控制的从业者系统化
专题命中 提示注入 :prompt injection(abstract);分类 cs.CY
AI总结 本文基于生产经验,将六类代理威胁映射到美欧金融监管义务,提出四种架构模式将手动流程自动化处理约80%案例,并报告三项负面结果。
从工具调用角度审视代码代理的红队测试:一项经验性安全评估
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。
AI告密者出故障:走向规避智能体监控
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。
Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/
Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示
专题命中 提示注入 :safety(abstract);分类 cs.AI
AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。
Comments Accepted at ICML 2026
GIF: 局部几何信息流控制用于大语言模型
机构 * Columbia University(哥伦比亚大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。
AutoDojo: 自适应攻击揭示LLM智能体的浅层防御与用户未指定限制
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对间接提示注入防御的静态基准不足,提出自适应攻击框架AutoDojo,通过迭代优化注入突破多数防御,并揭示动作开放任务的结构性限制。