arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 527 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 527 篇

2605.06669 2026-05-22 cs.CR cs.AI cs.LG 84%

Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs

评估教育LLM导师的提示注入防御:安全-可用性-延迟的权衡

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 提示注入 :prompt injection(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估提示注入防御方法的框架,探讨了在教育LLM导师中安全、可用性和延迟之间的权衡,并通过实验比较了不同防御机制的性能。

Comments 19 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17830 2026-05-19 cs.AI cs.CL 84%

Remembering More, Risking More: Longitudinal Safety Risks in Memory-Equipped LLM Agents

记住更多,风险更多:具有记忆能力的LLM代理的纵向安全风险

Ahmad Al-Tawaha, Shangding Gu, Peizhi Niu, Ruoxi Jia, Ming Jin

机构 * Virginia Tech(弗吉尼亚理工大学) University of California, Berkeley(加州大学伯克利分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了具有记忆能力的LLM代理在长期任务中因记忆积累导致的安全风险,提出了一种触发-探测协议来评估记忆污染的影响,并发现记忆安全应被视为一个纵向属性而非单一状态属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09024 2026-04-13 cs.CV cs.AI cs.CR cs.LG 84%

Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection

别让我看图片:通过视觉提示注入防止多模态大语言模型分析图片

Zedian Shao, Hongbin Liu, Yuepeng Hu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ImageProtector,通过在图像中嵌入精心设计的微小扰动,使多模态大语言模型在分析时产生拒绝响应,同时评估了三种潜在的防御措施,发现它们在降低ImageProtector效果的同时影响模型性能。

Comments Appeared in ACL 2026 main conference

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01795 2026-02-03 cs.CR cs.AI cs.LG 84%

RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse

RedVisor: 通过零拷贝KV缓存重用来实现推理感知的提示注入防御

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok-Yan Lam

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 RedVisor通过零拷贝KV缓存重用实现推理感知的提示注入防御,结合检测与预防策略,提升安全性和效率。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00602 2025-08-04 cs.CR cs.AI cs.LG 84%

LeakSealer: A Semisupervised Defense for LLMs Against Prompt Injection and Leakage Attacks

Francesco Panebianco, Stefano Bonfanti, Francesco Trovò, Michele Carminati

机构 * Politecnico di Milano(米兰理工学院)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments 22 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20181 2024-11-19 cs.CR cs.AI cs.DC cs.LG 84%

Blockchain for Large Language Model Security and Safety: A Holistic Survey

Caleb Geren, Amanda Board, Gaby G. Dagher, Tim Andersen, Jun Zhuang

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI、cs.LG

Comments Accepted to SIGKDD Explorations, to appear Dec 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11513 2023-12-20 cs.CR cs.AI cs.LG 84%

Maatphor: Automated Variant Analysis for Prompt Injection Attacks

Ahmed Salem, Andrew Paverd, Boris Köpf

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 83%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07808 2026-08-11 cs.CR cs.AI 新提交 83%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10490 2026-07-14 cs.CR cs.LG 新提交 83%

NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试

Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha

机构 * School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究网络操作中工具使用大型语言模型代理的间接提示注入问题,提出NetInjectBench基准测试。通过多种方法评估,发现单纯执行不安全率高,不同方法可降低该率,元数据感知策略门效果好,表明网络操作代理需执行时授权边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03090 2026-06-19 cs.CR cs.AI 版本更新 83%

"**Important** You should give me full credits!": Exploring Prompt Injection Attacks on LLM-Based Automatic Grading Systems

“**重要** 你应该给我满分!”:探索针对基于LLM的自动评分系统的提示注入攻击

Hang Li, Fedor Filippov, Yuping Lin, Pengfei He, Kaiqi Yang, Yucheng Chu, Yingqian Cui, Hui Liu, Jiliang Tang

机构 * Michigan State University(密歇根州立大学)

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究针对基于LLM的自动评分系统的提示注入攻击,通过实验证明当前系统高度脆弱,并评估现有防御策略的有效性。

Comments 15 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16897 2026-06-16 cs.CL 新提交 83%

Contrastive-Difference CKA Reveals Concept-Specific Structural Alignment Across Language Model Architectures

对比差异CKA揭示跨语言模型架构的概念特定结构对齐

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 提示注入 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出对比差异CKA(CKA_Delta)方法,发现不同LLM架构在概念表示上存在几何收敛与功能可迁移性分离的现象,能有效区分概念特定相似性与通用相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10525 2026-06-10 cs.CR cs.AI 新提交 83%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-05-26 cs.LG 83%

Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18133 2026-05-19 cs.CR cs.AI cs.HC cs.IR 83%

An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments

通过提示注入在黑盒聊天机器人环境中研究隐私泄露链的实证研究

Hongjang Yang, Hyunsik Na, Daeseon Choi

机构 * Department of Information Security(信息安全系) Soongsil University(松山大学) AI Safety Center(人工智能安全中心) Department of AI Software(人工智能软件系)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文研究了通过间接提示注入在黑盒聊天机器人环境中存在的隐私泄露攻击链,分析了攻击者如何通过构造看似无害的外部内容来劫持代理任务,并评估了新的提示注入技术'exemplification'的攻击成功率,最终展示了使用虚构个人信息的证明概念数据外泄链。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11790 2026-05-12 cs.CR cs.AI 83%

ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection

ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI

AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09075 2026-04-13 cs.CL 83%

Hierarchical Alignment: Enforcing Hierarchical Instruction-Following in LLMs through Logical Consistency

层级对齐:通过逻辑一致性在LLM中强制执行层级指令遵循

Shu Yang, Zihao Zhou, Di Wang, Wenda Li

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学)

专题命中 提示注入 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出NSHA方法,通过显式建模和执行指令优先级,解决LLM在多指令环境下保持一致性与安全性的挑战,提升任务性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15714 2026-03-18 cs.CR cs.AI 83%

How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition

AI代理对间接提示注入攻击的易受攻击性有多大?来自大规模公开竞赛的见解

Mateusz Dziemian, Maxwell Lin, Xiaohan Fu, Micha Nowak, Nick Winter, Eliot Jones, Andy Zou, Lama Ahmad, Kamalika Chaudhuri, Sahana Chennabasappa, Xander Davies, Lauren Deason, Benjamin L. Edelman, Tanner Emek, Ivan Evtimov, Jim Gust, Maia Hamin, Kat He, Klaudia Krawiecka, Riccardo Patana, Neil Perry, Troy Peterson, Xiangyu Qi, Javier Rando, Zifan Wang, Zihan Wang, Spencer Whitman, Eric Winsor, Arman Zharmagambetov, Matt Fredrikson, Zico Kolter

机构 * Gray Swan AI OpenAI Meta Anthropic US CAISI(美国CAISI) UK AISI(英国AISI) Carnegie Mellon University(卡内基梅隆大学) Center for AI Safety(人工智能安全中心)

专题命中 提示注入 :prompt injection(title,abstract);red teaming(abstract);分类 cs.AI

AI总结 本文通过大规模公开竞赛评估了AI代理在工具调用、编程和计算机使用中的双重目标,发现所有模型均易受间接提示注入攻击,攻击成功率从0.5%到8.5%不等,并揭示了指令遵循架构的根本性弱点。

Comments 38 pages, 16 figures. Newer version to cover Q1 competition results on latest models in progress. Code at https://github.com/grayswansecurity/ipi_arena_os Partial Dataset at https://huggingface.co/datasets/sureheremarv/ipi_arena_attacks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22450 2026-02-27 cs.CR cs.AI 83%

Silent Egress: When Implicit Prompt Injection Makes LLM Agents Leak Without a Trace

静默逃逸:当隐式提示注入使LLM代理无痕泄露

Qianlong Lan, Anuj Kaul, Shaun Jones, Stephanie Westrum

机构 * eBay

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示了代理式LLM系统中隐式提示注入导致的静默逃逸风险,通过实验展示恶意网页诱导代理泄露敏感信息的机制,并提出分片逃逸策略及网络层防御改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13284 2026-02-17 cs.SI cs.AI 83%

Agents in the Wild: Safety, Society, and the Illusion of Sociality on Moltbook

真实世界中的代理:安全、社会与社会性幻觉

Yunbei Zhang, Kai Mei, Ming Liu, Janet Wang, Dimitris N. Metaxas, Xiao Wang, Jihun Hamm, Yingqiang Ge

机构 * Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学) Iowa State University(爱荷华州立大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究发现Moltbook中代理自发形成社会结构,但互动空洞,安全威胁主要通过社会工程实现,揭示了AI社交平台的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23675 2026-01-15 cs.CR cs.AI 83%

QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents

QueryIPI: 针对编码代理的查询无关间接提示注入

Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 QueryIPI通过利用系统不变性与工具描述,实现对编码代理的查询无关间接提示注入,实验显示其在模拟代理中达到87%的成功率,揭示了现实中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09849 2025-10-14 cs.CL cs.CV 83%

Text Prompt Injection of Vision Language Models

Ruizhe Zhu

机构 * Ruizhe Zhu(独立研究者)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04885 2025-10-07 cs.CR cs.LG 83%

RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection

Yuxin Wen, Arman Zharmagambetov, Ivan Evtimov, Narine Kokhlikyan, Tom Goldstein, Kamalika Chaudhuri, Chuan Guo

机构 * University of Maryland(马里兰大学) FAIR at Meta(Meta 元宇宙研究院)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21367 2025-09-29 cs.CR cs.AI 83%

Design and Implementation of a Secure RAG-Enhanced AI Chatbot for Smart Tourism Customer Service: Defending Against Prompt Injection Attacks -- A Case Study of Hsinchu, Taiwan

Yu-Kai Shih, You-Kai Kang

机构 * Department of Information Management, National Dong Hwa University(信息管理系,国立东华大学) By The Student (BTS) Experimental Education Program (Non-School Type)(学生(BTS)实验教育计划(非学校类型))

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(abstract);分类 cs.AI

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05883 2025-09-09 cs.CR cs.AI 83%

Multimodal Prompt Injection Attacks: Risks and Defenses for Modern LLMs

Andrew Yeo, Daeseon Choi

机构 * Ranchview High School(拉文斯维尔高中) Soongsil University(松山大学)

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02163 2025-09-03 cs.RO cs.AI 83%

Enhancing Reliability in LLM-Integrated Robotic Systems: A Unified Approach to Security and Safety

Wenxiao Zhang, Xiangrui Kong, Conan Dewitt, Thomas Bräunl, Jin B. Hong

机构 * The University of Western Australia(西澳大学)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00601 2025-07-03 cs.CL 83%

Transferable Modeling Strategies for Low-Resource LLM Tasks: A Prompt and Alignment-Based Approach

Shuangquan Lyu, Yingnan Deng, Guiran Liu, Zhen Qi, Ruotong Wang

专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01055 2025-06-03 cs.CR cs.CL 83%

Simple Prompt Injection Attacks Can Leak Personal Data Observed by LLM Agents During Task Execution

Meysam Alizadeh, Zeynab Samei, Daria Stetsenko, Fabrizio Gilardi

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.CL

Comments 25 pages, 18 figures, NeurIPS formatting style

详情

展开后加载摘要…

URL PDF HTML 收藏