arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 85 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 85 篇

2607.23586 2026-07-28 cs.AI cs.CR 新提交 57%

Are You Still the Agent I Authorized? Earned Authority under a Fixed Ceiling for Evolving Agents

你还是我授权的那个智能体吗?在固定上限下演化智能体的获得性权限

Zhaoxi Zhang, Xiaomei Zhang

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究长期存在的人工智能智能体部署后演化引发的授权问题,提出状态边界模型阐述授权连续性,通过固定过渡包络和效果上限,区分请求与实现效果,证明突变不会超上限,还映射了六种突变类别的授权后果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19595 2026-07-23 cs.CR cs.CL 新提交 57%

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19432 2026-07-23 cs.CR cs.AI 新提交 57%

ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems

ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击

Om Narayan, Rashmi Jyoti, Ramkinker Singh

机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 57%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17535 2026-07-21 cs.CR cs.CL 新提交 57%

Salience Induction against Multi-Hop RAG Agents: Threat and Defense

针对多跳检索增强生成智能体的显著性诱导:威胁与防御

Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

机构 * National University of Defense Technology(国防科技大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究多跳检索增强生成智能体面临的新攻击面——显著性通道,提出显著性诱导方法并定义操作符类,构建管道,引入基准。通过实验评估多种模型和架构,展示该方法有效性,强调智能体RAG需防御显著性 - 相关性解耦。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14006 2026-07-16 cs.CR cs.AI 新提交 57%

Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation

重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反

Mohammad Allahbakhsh, Mohammad Hassan Bahari, Moslem Attar-Raouf

机构 * Sensifai BV(Sensifai公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。

Comments 42 pages, 5 Tables, 21 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05277 2026-07-07 cs.CR cs.LG 新提交 57%

Untrusted Content Masking for Web Agents with Security Guarantees

具备安全保证的Web智能体不可信内容掩码技术

Kristina Nikolić, Egor Zverev, Javier Rando, Matthew Jagielski, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) ISTA(瑞士信息科学与技术学院) Anthropic(Anthropic公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 针对Web智能体的提示注入安全边界缺失问题,提出UCM方法,利用网页DOM区分内容区域,通过掩码与沙箱交互恢复安全边界,实现带安全保障的Web环境交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05120 2026-07-07 cs.CR cs.AI 新提交 57%

Agent Data Injection Attacks are Realistic Threats to AI Agents

智能体数据注入攻击对人工智能智能体构成现实威胁

Woohyuk Choi, Juhee Kim, Taehyun Kang, Jihyeon Jeong, Luyi Xing, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学) Largosoft University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 介绍智能体数据注入攻击(ADI)这一新型间接提示注入,其伪装可信数据注入恶意数据使智能体执行意外操作,研究发现现实智能体漏洞及ADI在多种模型和智能体设置中有效,揭示智能体安全关键差距。

Comments 19 pages, 19 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 57%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 57%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25836 2026-06-29 cs.AI 新提交 57%

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

AI告密者出故障:走向规避智能体监控

Hyejun Jeong, Dzung Pham, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出智能体监控问题,创建SurveilBench数据集评估模型监控能力,并开发三种规避技术(隐藏、欺骗、诱导过度升级)以保护用户。

Comments The code and Demo are available at https://aisec.cs.umass.edu/demo/ai-snitches-get-stitches/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 57%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15057 2026-06-23 cs.CR cs.AI 新提交 57%

AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents

AutoDojo: 自适应攻击揭示LLM智能体的浅层防御与用户未指定限制

Xinhang Ma, Taoran Li, Chaowei Xiao, Zhiyuan Yu, Ning Zhang, Yevgeniy Vorobeychik

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对间接提示注入防御的静态基准不足,提出自适应攻击框架AutoDojo,通过迭代优化注入突破多数防御,并揭示动作开放任务的结构性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13038 2026-06-12 cs.AI 新提交 57%

Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior

Nous: 提取并注入预测市场行为背后认知的尝试

Haowei Qian

机构 * Independent Researcher(独立研究员)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM代理在预测市场中认知同质化问题,提出Nous方法从真实交易行为提取八维行为画像并注入提示,发现提取部分有效但提示注入无法传递认知多样性。

Comments 37 pages, 1 figure, 7 tables. Reproduction artifacts (code, frozen profiles, prompts, model outputs): https://github.com/WillChienT/nous-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21824 2026-07-27 cs.CR 新提交 50%

Protocol-Level Attacks on Agentic Commerce Platforms: A Cross-Platform Taxonomy, AIP-Bench, and Unified Defense

对智能商务平台的协议级攻击:跨平台分类法、AIP基准和统一防御

Yedidel Louck

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究智能商务平台协议层安全问题,识别出33个结构性漏洞。贡献分类法,构建AIP-Bench基准和PCAT防御机制,将部分结构类攻击成功率降至零,强调协议层安全防护的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10080 2026-07-14 cs.IR 新提交 50%

The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment

多语言和关键词对抗性注入对大语言模型相关性判断的影响

Nguyen Khoi Vo, Duy Duong Tuong, Oleg Zendel, Mark Sanderson

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09938 2026-07-14 cs.HC 新提交 50%

"Code Is Cheap. Show Me the Talk.": Lessons from Teaching and Managing AI Coding Tool Usage in a Visualization Course

“代码很廉价。给我看看讲解。”:可视化课程中教授和管理人工智能编码工具使用的经验教训

Zhongzheng Xu, Taehyun Yang, Fumeng Yang

专题命中 提示注入 :prompt injection(abstract)

AI总结 在可视化课程中分享管理和教授人工智能使用的经验,实施提示注入等,发现学生使用情况及问题,指出需明确人工智能使用界限、提示指导,教学生质疑并适应通用设计。

Comments 5 Figures, 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07433 2026-07-09 cs.CR 新提交 50%

Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting

警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击

Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。

Comments Website: https://sites.google.com/view/agentic-botnets/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 50%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22779 2026-06-23 cs.CR cs.CV 新提交 50%

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings

DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示

Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 提示注入 :prompt injection(abstract)

AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 50%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20922 2026-06-23 cs.CR 新提交 50%

Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning

三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击

Shanghao Shi, Xiao Wang, Chaoyu Zhang, Hao Li, Wenjing Lou, Thomas Hou, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

专题命中 提示注入 :prompt injection(abstract)

AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18673 2026-06-18 cs.CR 新提交 50%

Understanding and Mitigating Prompt Leaking Attacks in Real-World LLM-Based Applications

理解并缓解真实世界基于LLM的应用中的提示泄露攻击

Yong Yang, Chong Fu, Tong Zhang, Rui Zeng, Qingming Li, Tianyu Du, Zonghui Wang, Shouling Ji, Wenzhi Chen

专题命中 提示注入 :alignment(abstract)

AI总结 本研究系统测量了1200个真实世界基于LLM的应用,发现超过80%会泄露系统提示,并提出了基于注意力漂移分析的AREA防御方法,在保持可用性的同时有效防止泄露。

Comments Accepted at ACM CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 50%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07683 2026-06-09 cs.SE eess.SP 新提交 50%

Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review

审查代码,而非故事:代码优先同行评审的愿景与协议

Jienan Chen

专题命中 提示注入 :prompt injection(abstract)

AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。

Comments 17 pages, vision and protocol paper

详情

展开后加载摘要…

URL PDF HTML 收藏