Rethinking Agent Security as a Networking Problem
将智能体安全重新思考为一个网络问题
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
将智能体安全重新思考为一个网络问题
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 该研究针对现有以智能体为中心的安全防御无法可靠防范AI智能体风险的问题,借鉴网络领域原则,提出结合确定性执行与语义策略的AI智能体安全系统设计思路。
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract)
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
行为技能重构:从大语言模型智能体技能中重构隐藏功能
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。
Comments 20 pages, 5 figures, 20 tables
了解你的智能体:基于侦察的人工智能智能体渗透测试
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 研究针对人工智能智能体的渗透测试,提出通过形式化智能体侦察,在KYA框架中利用探测、构建配置文件等实现黑盒侦察驱动的渗透测试自动化,并进行评估与发布,以提升智能体安全性。
PRISM:从语言模型激活中恢复指令集
机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) ; Microsoft(微软) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。
Comments Under Review
静默更新:测量并弥合部署后的披露差距
专题命中 提示注入 :safety(abstract);分类 cs.CY
AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。
Comments Accepted to AIES-26
SkillsMetric:映射恶意智能体技能静态分析的检测边界
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。
Comments 6 pages, 3 figures, 3 tables
文本中恶意指令的鲁棒上下文感知检测
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。
关系先验作为基于大语言模型的多智能体系统中的收敛压力
专题命中 提示注入 :alignment(abstract);分类 cs.CL
AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。
你的智能体大模型会秘密编码间接提示注入暴露的潜在信号
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用
Comments Preprint
推理时的指令层级调控
专题命中 提示注入 :safety(abstract);分类 cs.CL
AI总结 针对前沿大语言模型常违反指令层级的问题,提出无需训练的V-Steer方法,通过编辑缓存值向量调控指令层级,提升角色冲突基准准确率,性能优于仅提示基线,部分场景达到SoTA训练方法水平。
Comments Published as a conference paper at COLM '26; the first two authors contributed equally to the work. 24 pages, 9 figures
智能云诱饵:一种用于自主入侵调查的欺骗驱动框架
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究针对云遥测使入侵理解困难的问题,提出云诱饵人工智能代理框架,通过会话聚合运算符、动态提示生成等方法,在十个AWS S3场景测试中效果良好,能压缩调查路径,多数场景可完全重建,且延迟短。
你还是我授权的那个智能体吗?在固定上限下演化智能体的获得性权限
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究长期存在的人工智能智能体部署后演化引发的授权问题,提出状态边界模型阐述授权连续性,通过固定过渡包络和效果上限,区分请求与实现效果,证明突变不会超上限,还映射了六种突变类别的授权后果。
孪生智能体:用于特权分离智能体的上下文残差压缩
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Chicago(芝加哥大学) ; University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL
AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。
ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击
机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) ; Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) ; Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。
可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试
机构 * Texas Tech University(德克萨斯技术大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。
针对多跳检索增强生成智能体的显著性诱导:威胁与防御
机构 * National University of Defense Technology(国防科技大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.CL
AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。
Comments 18 pages, 4 figures, 12 tables
重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反
机构 * Sensifai BV(Sensifai公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。
Comments 42 pages, 5 Tables, 21 references
具备安全保证的Web智能体不可信内容掩码技术
机构 * ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; ISTA(瑞士信息科学与技术学院) ; Anthropic(Anthropic公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。
智能体数据注入攻击对人工智能智能体构成现实威胁
机构 * Seoul National University(首尔国立大学) ; Largosoft ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。
Comments 19 pages, 19 figures, 7 tables
用于智能体控制的生物基序
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。
Comments 80 pages. Preprint; feedback welcome
通过计算机系统视角理解与评估爪类智能体安全性
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; NUS(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; KACST(阿卜杜勒阿齐兹国王科技城) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; NVIDIA(英伟达) ; Google DeepMind(谷歌DeepMind) ; UW Seattle(华盛顿大学西雅图分校) ; HUMAIN(胡迈因研究所)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。
AI告密者出故障:走向规避智能体监控
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。
Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/
GIF: 局部几何信息流控制用于大语言模型
机构 * Columbia University(哥伦比亚大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。
AutoDojo: 自适应攻击揭示LLM智能体的浅层防御与用户未指定限制
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对间接提示注入防御的静态基准不足,提出自适应攻击框架AutoDojo,通过迭代优化注入突破多数防御,并揭示动作开放任务的结构性限制。
Nous: 提取并注入预测市场行为背后认知的尝试
机构 * Independent Researcher(独立研究员)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 针对LLM代理在预测市场中认知同质化问题,提出Nous方法从真实交易行为提取八维行为画像并注入提示,发现提取部分有效但提示注入无法传递认知多样性。
Comments 37 pages, 1 figure, 7 tables. Reproduction artifacts (code, frozen profiles, prompts, model outputs): https://github.com/WillChienT/nous-paper
对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御
专题命中 提示注入 :prompt injection(abstract)
AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。
多语言和关键词对抗性注入对大语言模型相关性判断的影响
专题命中 提示注入 :prompt injection(abstract)
AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。
“代码很廉价。给我看看讲解。”:可视化课程中教授和管理人工智能编码工具使用的经验教训
专题命中 提示注入 :prompt injection(abstract)
AI总结 在可视化课程中分享管理和教授人工智能使用的经验,实施提示注入等,发现学生使用情况及问题,指出需明确人工智能使用界限、提示指导,教学生质疑并适应通用设计。
Comments 5 Figures, 7 Pages
警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击
专题命中 提示注入 :prompt injection(abstract)
AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。
Comments Website: https://sites.google.com/view/agentic-botnets/home