arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 9 篇

2608.07808 2026-08-11 cs.CR cs.AI 新提交 83%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08100 2026-08-11 cs.CR cs.AI cs.LG 新提交 81%

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

防御检索增强型入侵检测系统免受知识投毒与提示注入攻击

Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。

Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08939 2026-08-11 cs.AI 新提交 79%

Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection

并非无障碍功能(A11y):安卓无障碍功能如何将移动智能体暴露于间接提示注入攻击

Rahul Deivasigamani, Sayeda Faatin Alvi, Derqui Andrea, Kaushal Punjabi, Stjepan Picek

机构 * Radboud University Nijmegen(奈梅亨拉德堡德大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文揭示安卓移动智能体框架因依赖未过滤的无障碍元数据,存在间接提示注入漏洞,经实证验证其攻击成功率达0.822,需强化零信任输入验证等安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08795 2026-08-11 cs.CR cs.CL 新提交 79%

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

迈向元认知少样本间接提示注入:基于结果条件反射的策略抽象

Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出SAVOR方法,将攻击适配转向离线策略蒸馏,仅需一次目标智能体查询,在多基准与模型上攻击成功率显著优于现有方法,且记忆可跨防御迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08027 2026-08-11 cs.CR cs.LG 新提交 79%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 79%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19430 2026-08-11 cs.CR cs.AI cs.MA 版本更新 77%

ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

通道卫士:安全模型无法组合成安全的多智能体系统

Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh

机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 57%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15596 2026-08-11 cs.CR 版本更新 50%

From Neural Intent to Cryptographic Authorization: Securing AI-Driven Enterprise Workflows

从神经意图到加密授权:管理智能代理工作流程

Jiasi Weng, Jian Weng, Minrong Chen, Ming Li, Jia-Nan Liu, Zhi Li, Yue Zhang

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究人工智能驱动的智能代理工作流程中的安全问题,提出神经加密服务(NCS),通过神经符号设计,在大语言模型代理和特权工具间构建安全治理平面,经实验评估,能大幅降低攻击成功率,转变代理安全验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏