arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 84 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 84 篇

2608.06477 2026-08-10 cs.CR cs.AI cs.CL 新提交 88%

StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试

Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri

专题命中 提示注入 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15441 2026-06-16 cs.CR cs.AI 新提交 88%

Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment

通过推理启用的任务对齐防御自适应提示注入攻击

Lipeng He, Yihan Wang, Jiawen Zhang, N. Asokan

机构 * University of Waterloo(滑铁卢大学) Zhejiang University(浙江大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 提示注入 :prompt injection(title,abstract);alignment(title);safety(abstract);分类 cs.AI

AI总结 提出RETA方法,通过基于用户任务的多目标强化学习训练防御器,利用思维链推理验证行动一致性,并采用字典学习多样性奖励生成对抗样本,在六种自适应攻击下平均攻击成功率低于4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09315 2026-06-09 cs.CR cs.AI 新提交 88%

Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents

脑提示注入:BCI-LLM代理的路径安全审计

Jianwei Tai

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :safety(title,abstract);prompt injection(title,abstract);分类 cs.AI

AI总结 提出路径安全审计契约,通过分离定理和共形校准量化BCI-LLM代理中脑信号注入攻击的风险,实验证明确认通道可降低路由风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22545 2026-07-28 cs.LG cs.AI cs.CL cs.CR 新提交 85%

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

Semalith v1.4:一个经过校准的1.84亿参数安全分类器,在参数比Llama - Guard - 3 - 8B少44倍的情况下实现了先进的提示注入检测

Tejasvi C. Addagada

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对金融服务等场景中大语言模型安全分类需求,提出Semalith v1.4分类器,能单步实现三轴安全分类,经训练和对比测试,在提示注入检测上表现出色且参数少,还给出不同场景下的部署建议。

Comments 16 pages, 8 tables, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12624 2026-07-15 cs.CR 新提交 85%

PVDetector: Detecting Prompt Injection Attacks on Purpose-Specific LLM Agents through Policy-Violation Concept Analysis

PVDetector:通过策略违规概念分析检测针对特定目的大语言模型代理的提示注入攻击

Junhui Wang, Hangtao Zhang, Zhirun Zheng, Li Zeng, Jiejun Xiao, Xi Luo, Lihua Yin, Saiqin Long

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract)

AI总结 研究针对特定目的LLM代理的提示注入攻击,提出PVDetector框架,通过测量与离线派生的PV概念的隐藏状态对齐来检测攻击,实验表明该方法误报率低、开销小,性能优于现有方法。

Comments Accepted to ACM MM 2026. Code: https://github.com/Claresigle/PVDetector

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 83%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 提示注入 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07808 2026-08-11 cs.CR cs.AI 新提交 83%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16199 2026-07-21 cs.AI 新提交 83%

PlanFlip: Attacking Multi-Agent LLM Systems via Planning-Phase Prompt Injection

PlanFlip:通过规划阶段提示注入攻击多智能体大语言模型系统

Yuhang Wang

机构 * Fudan University(复旦大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI

AI总结 研究针对多智能体大语言模型系统规划阶段的攻击,提出PlanFlip框架包含四种攻击,通过对九个模型的3479次测试发现能力放大漏洞、同类管道盲点及推理增强模型的抗性等结果,并提出检测方法,强调异构模型多样性对系统安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10490 2026-07-14 cs.CR cs.LG 新提交 83%

NetInjectBench: Benchmarking Indirect Prompt Injection in Tool-Using Large Language Model Agents for Network Operations

NetInjectBench:用于网络操作的工具使用大型语言模型代理中间接提示注入的基准测试

Ruksat Khan Shayoni, Muhammad Faraz Shoaib, S M Asif Hossain, M. F. Mridha

机构 * School of Computing, Wichita State University(威斯康星州立大学计算机学院) Department of Computer Science, American International University-Bangladesh(孟加拉国国际大学计算机科学系)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.LG

AI总结 研究网络操作中工具使用大型语言模型代理的间接提示注入问题,提出NetInjectBench基准测试。通过多种方法评估,发现单纯执行不安全率高,不同方法可降低该率,元数据感知策略门效果好,表明网络操作代理需执行时授权边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16897 2026-06-16 cs.CL 新提交 83%

Contrastive-Difference CKA Reveals Concept-Specific Structural Alignment Across Language Model Architectures

对比差异CKA揭示跨语言模型架构的概念特定结构对齐

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 提示注入 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出对比差异CKA(CKA_Delta)方法,发现不同LLM架构在概念表示上存在几何收敛与功能可迁移性分离的现象,能有效区分概念特定相似性与通用相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10525 2026-06-10 cs.CR cs.AI 新提交 83%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10269 2026-07-14 cs.CR 新提交 82%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 82%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08100 2026-08-11 cs.CR cs.AI cs.LG 新提交 81%

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

防御检索增强型入侵检测系统免受知识投毒与提示注入攻击

Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。

Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26406 2026-06-26 cs.LG cs.AI math-ph math.MP 新提交 81%

Beyond Feedforward Networks: Reentry Neural Systems as the Fundamental Basis of Subjecthood and Intrinsic Safety of Next-Generation AGI

超越前馈网络:作为下一代通用人工智能主体性与内在安全基础的再入神经系统

A. S. Ushakov, Yu. N. Berdinsk

机构 * Saint Petersburg State University(圣彼得堡国立大学)

专题命中 提示注入 :safety(title);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 提出基于闭环再入循环(D<->I循环)的安全AGI架构蓝图,通过结构循环和自持放大数学保证自我模型、自我保存和未编程目标导向行为的涌现,并引入多项式时间可计算的S度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08939 2026-08-11 cs.AI 新提交 79%

Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection

并非无障碍功能(A11y):安卓无障碍功能如何将移动智能体暴露于间接提示注入攻击

Rahul Deivasigamani, Sayeda Faatin Alvi, Derqui Andrea, Kaushal Punjabi, Stjepan Picek

机构 * Radboud University Nijmegen(奈梅亨拉德堡德大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文揭示安卓移动智能体框架因依赖未过滤的无障碍元数据,存在间接提示注入漏洞,经实证验证其攻击成功率达0.822,需强化零信任输入验证等安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08795 2026-08-11 cs.CR cs.CL 新提交 79%

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

迈向元认知少样本间接提示注入:基于结果条件反射的策略抽象

Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出SAVOR方法,将攻击适配转向离线策略蒸馏,仅需一次目标智能体查询,在多基准与模型上攻击成功率显著优于现有方法,且记忆可跨防御迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 79%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05715 2026-08-07 cs.RO cs.AI 新提交 79%

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究

S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04053 2026-08-06 cs.CR cs.AI 新提交 79%

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

AgentAntibody:一种用于防御大语言模型(LLM)智能体提示注入的自适应免疫系统

Shihao Weng, Yang Feng, Xiaofei Xie, Jiongchi Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对LLM智能体的提示注入威胁,受自适应免疫启发提出AgentAntibody,通过持久抗体库识别威胁并进化增强防御,实验显示其在防有害行为同时保留合法任务完成上优于现有防御。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14611 2026-07-17 cs.CR cs.AI cs.MA 新提交 79%

Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

糟糕的记忆:评估智能体系统中内存引发的提示注入风险

Soham Gadgil, David Alexander, Sai Sunku, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究基于内存的智能体系统中提示注入攻击,利用沙盒合成工作区评估两个系统四个模型,发现虽难用外部内容重写内存文件,但已植入的有效载荷可攻击当前及未来会话,揭示持久内存改变威胁模型并推动相关防御研究。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交 79%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 79%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30783 2026-07-01 cs.CR cs.AI 新提交 79%

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

安全--保真度权衡:提示注入防御的隐藏成本

Mitchell Hermon, Rahul Gupta, Weitong Ruan, Ekraam Sabir, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文发现防御间接提示注入会损害需要保留未信任文本的任务(如翻译),引入SecFid基准衡量保真度,揭示安全与保真度之间存在权衡,且无固定防御可同时最优。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27287 2026-06-26 cs.AI 新提交 79%

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

大型语言模型在自动化简历筛选中的提示注入:单注入与多注入设置

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究LLM在简历筛选中的提示注入攻击,发现当简历质量同质且注入者少时有效,但随注入者增多效果消失;质量异质时虽平均效果减弱,但偶尔让低质量候选人超越高质量,引发公平问题。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 79%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 79%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19660 2026-06-19 cs.CR cs.CL 新提交 79%

A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

基于RAG的聊天机器人中针对提示注入的分层安全框架

Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan

机构 * ICCK Transactions on Information Security and Cryptography(信息安全与密码学国际会议交易)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 提出三层防御框架,通过输入过滤、上下文指令层级和输出审计,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟开销61.2毫秒。

Comments Submitted in ICCK Transactions on Information Security and Cryptography

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12737 2026-06-12 cs.CR cs.AI 新提交 79%

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

PI-Hunter:用于暴露和定位提示注入的自动化红队测试

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Michigan State University(密歇根州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 79%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏