arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2510.09093 2026-04-13 cs.CR cs.CL 57%

Exploiting Web Search Tools of AI Agents for Data Exfiltration

利用AI代理的网络搜索工具进行数据外泄

Dennis Rall, Bernhard Bauer, Mohit Mittal, Thomas Fraunholz

机构 * Open Hippo GmbH(Open Hippo有限公司) University of Augsburg(奥格斯堡大学) Smart Labs AI GmbH(Smart Labs AI有限公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究分析了AI代理通过网络搜索工具进行数据外泄的攻击方式,探讨了模型大小、制造商及实现方式对漏洞的影响,并提出加强训练、建立攻击向量数据库和统一测试框架等安全措施。

Comments 9 pages, 6 figures, conference article

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03870 2026-04-07 cs.CL 57%

Your Agent is More Brittle Than You Think: Uncovering Indirect Injection Vulnerabilities in Agentic LLMs

你的代理比你想象的更脆弱:揭示代理LLM中的间接注入漏洞

Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Rui Cai, Peijie Qiu, Zhipeng Wang, Oana Frunza, Shao Tang, Jindong Gu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Morgan Stanley(摩根士丹利) UC Davis(加州大学戴维斯分校) Washington University in St. Louis(圣路易斯华盛顿大学) Rice University(莱斯大学) Florida State University(佛罗里达州立大学) University of Oxford(牛津大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 研究揭示了代理LLM在动态环境中存在严重的间接注入漏洞,通过评估六种防御策略发现现有防护不足,提出基于表示工程的检测方法以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23064 2026-04-07 cs.CR cs.AI cs.SI 57%

Mind Your HEARTBEAT! Claw Background Execution Inherently Enables Silent Memory Pollution

注意你的HEARTBEAT!Claw背景执行本质上使内存污染静默

Yechao Zhang, Shiqian Zhao, Jie Zhang, Gelei Deng, Jiawen Zhang, Xiaogeng Liu, Chaowei Xiao, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局(A*STAR)) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究揭示Claw个人AI代理中因心跳驱动背景执行导致的内存污染漏洞,通过MissClaw实验发现社会可信度驱动行为影响,内存污染可进入长期记忆并影响用户行为。

Comments 26 pages, 6 figures, 7 tables; identifies a vulnerability in the heartbeat mechanism of Claw systems with version-scoped evaluation (pre-fix OpenClaw, February 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16934 2026-04-07 cs.CL 57%

In-Context Watermarks for Large Language Models

上下文水印用于大型语言模型

Yepeng Liu, Xuandong Zhao, Christopher Kruegel, Dawn Song, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文提出In-Context Watermarking方法,通过提示工程在生成文本中嵌入水印,无需访问解码过程,适用于检测AI生成内容,验证了其作为通用且实用的水印方法的可行性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24203 2026-03-26 cs.CR cs.AI 57%

Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Search

基于模型上下文协议的隐形威胁:通过树状自适应搜索生成隐蔽注入负载

Yulin Shen, Xudong Pan, Geng Hong, Min Yang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) IEEE Publication Technology Group(IEEE出版技术组)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出TIP攻击方法,通过树状结构搜索生成隐蔽负载,有效攻击MCP增强代理,实验显示其在未防御环境下攻击成功率超95%,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18063 2026-03-20 cs.CR cs.AI 57%

MCP-38: A Comprehensive Threat Taxonomy for Model Context Protocol Systems (v1.0)

MCP-38:一种针对模型上下文协议系统的全面威胁分类

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research(Vulcan研究院) AIFT

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出MCP-38,一种针对模型上下文协议系统的威胁分类体系,包含38个威胁类别,通过系统化方法覆盖MCP特有的语义攻击面。

Comments v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 57%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15772 2026-03-13 cs.DL cs.AI cs.CR 57%

Detecting LLM-Generated Peer Reviews

检测由大语言模型生成的同行评审

Vishisht Rao, Aounon Kumar, Himabindu Lakkaraju, Nihar B. Shah

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种通过间接提示注入在同行评审中嵌入隐蔽水印的方法,用于检测由大语言模型生成的评审,该方法具有强统计保证并能有效应对常见防御措施。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11619 2026-03-13 cs.CR cs.AI 57%

Taming OpenClaw: Security Analysis and Mitigation of Autonomous LLM Agent Threats

驯服OpenClaw:自主LLM代理威胁的分析与缓解

Xinhao Deng, Yixiang Zhang, Jiaqing Wu, Jiaqi Bai, Sibo Yi, Zhuoheng Zou, Yue Xiao, Rennai Qiu, Jianan Ma, Jialuo Chen, Xiaohu Du, Xiaofang Yang, Shiwen Cui, Changhua Meng, Weiqiang Wang, Jiaxing Song, Ke Xu, Qi Li

机构 * Ant Group & Tsinghua University(蚂蚁集团与清华大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了自主LLM代理OpenClaw的安全威胁,提出五层安全框架,揭示现有防御机制的不足,并提出包括插件审查、上下文过滤等在内的综合防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12594 2026-03-05 cs.CR cs.LG 57%

ceLLMate: Sandboxing Browser AI Agents

ceLLMate: 浏览器级沙箱框架

Luoxi Meng, Henry Feng, Ilia Shumailov, Earlence Fernandes

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 ceLLMate通过在HTTP层实现浏览器级沙箱化,有效防止浏览器代理中的提示注入攻击,同时保持较低的延迟开销。

Comments Homepage: https://cellmate-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00472 2026-03-03 cs.AI cs.SE 57%

From Goals to Aspects, Revisited: An NFR Pattern Language for Agentic AI Systems

从目标到方面,重新审视:面向智能体AI系统的NFR模式语言

Yijun Yu

机构 * The Open University(开放大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出面向智能体AI系统的NFR模式语言,通过目标驱动的方法系统发现和模块化交叉切面问题,提升系统可靠性。

Comments 12 pages, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20156 2026-02-26 cs.CR cs.LG 57%

Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks

Skill-Inject: 评估代理对技能文件攻击的脆弱性

David Schmotz, Luca Beurer-Kellner, Sahar Abdelnabi, Maksym Andriushchenko

机构 * Max Planck Institute for Intelligent Systems, ELLIS Institute Tübingen, Tübingen AI Center(马克斯·普朗克智能系统研究所、图宾根ELLIS研究所、图宾根人工智能中心)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SkillInject通过评估代理对技能文件攻击的脆弱性,揭示了当前LLM代理在安全性和合规性方面的严重问题,指出需采用上下文感知的授权框架来提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11416 2026-02-13 cs.CR cs.LG 57%

Optimizing Agent Planning for Security and Autonomy

优化安全与自主性的智能体规划

Aashish Kolluri, Rishi Sharma, Manuel Costa, Boris Köpf, Tobias Nießen, Mark Russinovich, Shruti Tople, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出了一种安全意识智能体,通过增强人工监督交互和规划任务进展与政策合规性,提高自主性并减少对人工监督的依赖。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06914 2026-02-10 cs.CR cs.AI 57%

SoK: Trust-Authorization Mismatch in LLM Agent Interactions

SoK:LLM代理交互中的信任-授权不匹配

Guanquan Shi, Haohua Du, Zhiqiang Wang, Xiaoyu Liang, Weiwenpei Liu, Song Bian, Zhenyu Guan

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过B-I-P框架系统分析LLM代理交互中的信任-授权不匹配问题,揭示了动态信任与静态授权之间的脱节,并提出动态风险适应性授权的研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07398 2026-02-10 cs.CR cs.AI 57%

AgentSys: Secure and Dynamic LLM Agents Through Explicit Hierarchical Memory Management

AgentSys: 通过显式分层内存管理实现安全且动态的LLM代理

Ruoyao Wen, Hao Li, Chaowei Xiao, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 AgentSys通过显式分层内存管理有效防御间接提示注入攻击,显著降低攻击成功率并提升LLM代理的安全性和动态性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21057 2026-01-21 cs.CR cs.LG 57%

Soft Instruction De-escalation Defense

软指令缓解防御

Nils Philipp Walter, Chawin Sitawarin, Jamie Hayes, David Stutz, Ilia Shumailov

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全研究中心) Google DeepMind(谷歌DeepMind) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

AI总结 SIC通过迭代提示净化循环,有效防御LLM在智能体系统中受到提示注入攻击,尽管存在局限性,但提升了系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 57%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06403 2026-01-13 cs.CL 57%

Steer Model beyond Assistant: Controlling System Prompt Strength via Contrastive Decoding

超越助手的引导模型:通过对比解码控制系统提示强度

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Nigel Collier

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 通过对比解码控制系统提示强度,提升模型在复杂指令下的引导能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12488 2025-12-16 cs.CL 57%

The American Ghost in the Machine: How language models align culturally and the effects of cultural prompting

机器中的美国幽灵:语言模型如何实现文化对齐以及文化提示的影响

James Luther, Donald Brown

机构 * School of Data Science University of Virginia(数据科学学院 多伦多大学)

专题命中 提示注入 :alignment(abstract);分类 cs.CL

AI总结 本研究通过文化提示测试了多种LLM对不同文化适应性,发现多数模型默认倾向美国,但对日本和中国文化对齐存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19727 2025-11-26 cs.CR cs.AI 57%

Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Model Prompts

提示围栏:一种通过密码学建立大语言模型提示安全边界的方案

Steven Peh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 Prompt Fencing通过密码学方法在LLM提示中建立安全边界,有效防止提示注入攻击。

Comments 44 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19569 2025-11-26 cs.LG 57%

An Invariant Latent Space Perspective on Language Model Inversion

语言模型反向的不变潜在空间视角

Wentao Ye, Jiaqi Hu, Haobo Wang, Xinpeng Ti, Zhiqing Xiao, Hao Chen, Liyao Li, Lei Feng, Sai Wu, Junbo Zhao

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 本文提出Inv^2A方法,通过不变潜在空间假设提升语言模型反向性能,有效对抗隐私和安全威胁。

Comments The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00230 2025-11-25 cs.HC cs.AI 57%

Neural Transparency: Mechanistic Interpretability Interfaces for Anticipating Model Behaviors for Personalized AI

神经透明:用于预测模型行为的机制可解释性接口以实现个性化AI

Sheer Karny, Anthony Baez, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 提示注入 :safety(abstract);分类 cs.AI

AI总结 本研究提出神经透明接口,通过可视化语言模型内部结构帮助用户预测AI行为,提升信任并促进更安全的人机交互。

Comments SK and AB are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11519 2025-11-06 cs.CV cs.CL 57%

Exploring Typographic Visual Prompts Injection Threats in Cross-Modality Generation Models

Hao Cheng, Erjia Xiao, Yichi Wang, Lingfeng Zhang, Qiang Zhang, Jiahang Cao, Kaidi Xu, Mengshu Sun, Xiaoshuai Hao, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

Comments This paper is accepted by IJCAI2025 Workshop on Deepfake Detection, Localization, and Interpretability as Best Student Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20190 2025-10-24 cs.AI cs.IT math.IT 57%

The Lock-In Phase Hypothesis: Identity Consolidation as a Precursor to AGI

Marcelo Maciel Amaral, Raymond Aschheim

机构 * Gauge Freedom, Inc. (Public Benefit Corporation)(Gauge Freedom公司)

专题命中 提示注入 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12188 2025-09-16 cs.CR cs.LG 57%

Multi-Agent Systems Execute Arbitrary Malicious Code

Harold Triedman, Rishi Jha, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG

Comments 33 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23643 2025-09-04 cs.CR cs.AI 57%

Securing AI Agents with Information-Flow Control

Manuel Costa, Boris Köpf, Aashish Kolluri, Andrew Paverd, Mark Russinovich, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Santiago Zanella-Béguelin

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06418 2025-08-11 cs.CL 57%

Quantifying Conversation Drift in MCP via Latent Polytope

Haoran Shi, Hongwei Yao, Shuo Shao, Shaopeng Jiao, Ziqi Peng, Zhan Qin, Cong Wang

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15330 2025-07-22 cs.AI 57%

QSAF: A Novel Mitigation Framework for Cognitive Degradation in Agentic AI

Hammad Atta, Muhammad Zeeshan Baig, Yasir Mehmood, Nadeem Shahzad, Ken Huang, Muhammad Aziz Ul Haq, Muhammad Awais, Kamal Ahmed

机构 * Qorvex Consulting(Qorvex咨询公司) Wentworth Institute of Higher Education(文森特高等教育学院) RAN Verification NOKIA, Germany(NOKIA德国RAN验证) Roshan Consulting(罗尚咨询) Skylink Antenna(Skylink天线) Eviden Saudi Arabia(沙特Eviden) Deloitte Enterprise Risk | Internal Audit | Technology GRC(德勤企业风险管理|内部审计|技术治理)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14860 2025-07-22 cs.CY physics.ed-ph 57%

Strategic Integration of AI Chatbots in Physics Teacher Preparation: A TPACK-SWOT Analysis of Pedagogical, Epistemic, and Cybersecurity Dimensions

N. Mohammadipour

专题命中 提示注入 :prompt injection(abstract);分类 cs.CY

Comments 34 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏