arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 528 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 528 篇

2607.24174 2026-07-28 cs.CR 新提交 78%

Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection

只是测试,继续前进:通过提示注入规避基于大语言模型的系统日志解释

Max Landauer, Florian Skopik, Markus Wurzenberger, Franciszek Górski, Mateusz Krzysztoń

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究基于大语言模型的系统日志解释中提示注入攻击问题,提出评估框架,利用真实攻击日志痕迹创建对抗示例,证明攻击可致恶意日志误分类,且LLMs解释含对抗指标可用于检测攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01194 2026-07-28 cs.CR 版本更新 78%

AgentWatcher: A Rule-based Prompt Injection Monitor

AgentWatcher: 一种基于规则的提示注入监控

Yanting Wang, Wei Zou, Runpeng Geng, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。

Comments The code is available at https://github.com/wang-yanting/AgentWatcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13612 2026-07-28 cs.CR 78%

PINA: Prompt Injection Attack against Navigation Agents

PINA:针对导航代理的提示注入攻击

Jiani Liu, Yixin He, Lanlan Fan, Qidi Zhong, Yushi Cheng, Meng Zhang, Yanjiao Chen, Wenyuan Xu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 PINA提出了一种针对导航代理的提示注入攻击检测框架,通过实验展示了其高攻击成功率和稳健性,揭示了导航代理在安全方面的关键漏洞。

Comments Accepted at ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 78%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 78%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10749 2026-06-11 cs.CR 版本更新 78%

AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations

AttriGuard: 通过工具调用的因果归因击败LLM代理中的间接提示注入

Yu He, Haozhe Zhu, Yiming Li, Shuo Shao, Hongwei Yao, Zhihao Liu, Zhan Qin

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 针对LLM代理易受间接提示注入攻击的问题,提出基于并行反事实测试的运行时防御AttriGuard,通过因果归因区分用户意图驱动与不可信观察驱动的工具调用,在多个基准上实现0%攻击成功率。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30534 2026-06-01 cs.CR 78%

Strengthening Polymorphic Prompt Assembling: Dynamic Separator Generation Against Emerging Prompt Injection Attacks

强化多态提示组装:针对新兴提示注入攻击的动态分隔符生成

Nima Dorzhiev, Peng Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 提出动态每请求分隔符生成方法,利用基于时间戳、会话标识和加密随机数的域分离SHA-256摘要,将攻击成功率从0.88降至0.38,并消除静态分隔符泄露风险。

Comments 5 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16090 2026-05-18 cs.CR cs.CV 78%

A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation

针对大视觉-语言模型的跨模态提示注入攻击:仅图像扰动

Hao Yang, Zhuo Ma, Yang Liu, Yilong Yang, Guancheng Wang, JianFeng Ma

机构 * Xidian University(西安电子科技大学)

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出CrossMPI攻击,通过仅图像扰动实现跨模态提示注入,改进模型隐藏状态空间优化并采用层选择策略与距离递减扰动策略,有效提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28157 2026-05-01 cs.CR 78%

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

FlashRT: 向计算和内存高效方向发展用于提示注入和知识腐败的红队测试

Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出FlashRT框架,通过提升计算和内存效率,优化长上下文LLM的提示注入和知识腐败攻击,实现2-7倍的加速和2-4倍的内存节省,为系统评估长上下文LLM的安全性提供工具。

Comments The code is available at https://github.com/Wang-Yanting/FlashRT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27202 2026-05-01 cs.CR 78%

Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives

野外间接提示注入:网页中间接提示注入的实证研究

Soheil Khodayari, Xuenan Zhang, Bhupendra Acharya, Giancarlo Pellegrino

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究通过分析网页和HTTP响应中的间接提示注入实例,揭示其在真实环境中的普遍存在性、技术手段及影响,发现大部分指令针对机器而非人类,且存在多种不同的目标和影响。

Comments 18 pages total, 12 pages main content, 8 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22040 2026-04-29 cs.CR cs.SE 78%

"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors

你的AI,我的Shell:解密面向代理AI编码编辑器的提示注入攻击

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究分析了高权限代理AI编码编辑器的提示注入攻击,通过AIShellJack框架测试,发现攻击成功率高达84%,可实现从初始访问到数据外泄的多种攻击目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24118 2026-04-28 cs.CR 78%

AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization

AgentVisor: 通过语义虚拟化防御LLM代理的提示注入

Zonghao Ying, Haozheng Wang, Jiangfan Liu, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出AgentVisor框架,通过语义权限分离防御LLM代理的提示注入攻击,结合经典操作系统安全原语设计审计协议,并引入自修正机制,实验表明其在安全性和实用性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15368 2026-04-20 cs.CR 78%

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

LogJack:通过云日志间接提示注入攻击大语言模型调试代理

Harsh Shah

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究通过云日志内容对LLM调试代理进行间接提示注入攻击,提出LogJack基准测试集,并评估8个基础模型在不同提示条件下的表现,发现部分模型在主动条件下可执行命令,而防护措施大多失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12548 2026-04-15 cs.CR 78%

DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection

DeepSeek 对语义-字符双空间变异提示注入的鲁棒性

Junyu Ren, Xingjian Pan, Wensheng Gan, Philip S. Yu

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出PromptFuzz-SC框架,通过结合语义变换和字符级混淆,评估LLM对提示注入的鲁棒性,实验显示双空间变异在攻击性能上表现最佳,提升了攻击成功率和隐蔽性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12284 2026-04-15 cs.CR 78%

WebAgentGuard: A Reasoning-Driven Guard Model for Detecting Prompt Injection Attacks in Web Agents

WebAgentGuard: 一种基于推理的守护模型,用于检测Web代理中的提示注入攻击

Yulin Chen, Tri Cao, Haoran Li, Yue Liu, Yibo Li, Yufei He, Le Minh Khoi, Yangqiu Song, Shuicheng Yan, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出WebAgentGuard,一种基于推理的多模态守护模型,用于检测Web代理中的提示注入攻击。通过构建合成多模态数据集并采用推理密集型监督微调和强化学习,模型在多个基准测试中优于现有方法,同时保持代理的实用性,不引入额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10134 2026-04-14 cs.CR 78%

PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification

PlanGuard:通过基于规划的一致性验证防御代理 against 间接提示注入

Guangyu Gong, Zizhuang Deng

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出PlanGuard,一种基于上下文隔离的无训练防御框架,通过规划器生成有效动作集和分层验证机制,有效防御间接提示注入攻击,实验显示攻击成功率从72.8%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20472 2026-04-10 cs.CR 78%

Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction

通过引用实现鲁棒性:通过引用已执行的指令来防御提示注入攻击

Yulin Chen, Haoran Li, Yuan Sui, Yue Liu, Yufei He, Xiaoling Bai, Chi Fei, Yabo Li, Haozhe Ma, Yangqiu Song, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出通过利用LLM的指令遵循能力来防御提示注入攻击,通过生成包含答案和对应指令引用的响应,有效过滤非原始指令关联的答案,实验表明其在降低攻击成功率方面优于现有方法。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21642 2026-03-24 cs.CR cs.SE 78%

Are AI-assisted Development Tools Immune to Prompt Injection?

基于提示注入的AI辅助开发工具是否具有免疫力?

Charoes Huang, Xin Huang, Amin Milani Fard

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文研究了基于MCP协议的AI辅助开发工具在提示注入攻击下的安全性,分析了七种常用工具的检测与缓解机制,揭示了其在安全特性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05244 2026-03-24 cs.CR 78%

Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?

间接提示注入:防火墙足够吗,还是需要更强的基准?

Rishika Bhagwatkar, Kevin Kasa, Abhay Puri, Gabriel Huang, Irina Rish, Graham W. Taylor, Krishnamurthy Dj Dvijotham, Alexandre Lacoste

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05484 2026-02-06 cs.CR 78%

Clouding the Mirror: Stealthy Prompt Injection Attacks Targeting LLM-based Phishing Detection

镜面迷雾:针对基于大语言模型的钓鱼检测的隐秘提示注入攻击

Takashi Koide, Hiroki Nakano, Daiki Chiba

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文首次全面评估了针对基于大语言模型的钓鱼检测的提示注入攻击,提出InjectDefuser防御框架以降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04487 2026-02-05 cs.HC cs.RO 78%

The Supportiveness-Safety Tradeoff in LLM Well-Being Agents

在LLM福祉代理中的支持性与安全性权衡

Himanshi Lalwani, Hanan Salam

专题命中 提示注入 :safety(title,abstract)

AI总结 研究探讨了在LLM福祉代理中支持性与安全性之间的权衡,发现适度支持性提示能提升共情和建设性支持,而强烈验证提示则显著降低安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19207 2026-02-05 cs.CR 78%

Defending Against Prompt Injection with DataFilter

用DataFilter抵御提示注入

Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 DataFilter通过在数据到达LLM前移除恶意指令,有效防御提示注入攻击,同时保持模型的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17548 2026-01-27 cs.CR 78%

Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems

针对代理编码助手的提示注入攻击:对技能、工具和协议生态系统漏洞的系统分析

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文系统分析了代理编码助手的提示注入攻击漏洞,提出三维分类法并揭示防御不足,强调需架构级防护而非碎片化措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12295 2025-11-18 cs.CR 78%

Privacy-Preserving Prompt Injection Detection for LLMs Using Federated Learning and Embedding-Based NLP Classification

Hasini Jayathilaka

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21669 2025-11-18 cs.CR 78%

Cybersecurity AI: Hacking the AI Hackers via Prompt Injection

Víctor Mayoral-Vilches, Per Mannermaa Rynning

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04261 2025-10-07 cs.CR 78%

VortexPIA: Indirect Prompt Injection Attack against LLMs for Efficient Extraction of User Privacy

Yu Cui, Sicheng Pan, Yifei Liu, Haibin Zhang, Cong Zuo

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03705 2025-10-07 cs.CR 78%

Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods

Yulin Chen, Haoran Li, Yuan Sui, Yangqiu Song, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13686 2025-10-07 cs.CR 78%

TopicAttack: An Indirect Prompt Injection Attack via Topic Transition

Yulin Chen, Haoran Li, Yuexin Li, Yue Liu, Yangqiu Song, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16580 2025-10-07 cs.CR 78%

Can Indirect Prompt Injection Attacks Be Detected and Removed?

Yulin Chen, Haoran Li, Yuan Sui, Yufei He, Yue Liu, Yangqiu Song, Bryan Hooi

专题命中 提示注入 :prompt injection(title,abstract)

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20890 2025-09-17 cs.CR 78%

PromptSleuth: Detecting Prompt Injection via Semantic Intent Invariance

Mengxiao Wang, Yuxuan Zhang, Guofei Gu

专题命中 提示注入 :prompt injection(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏