arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2604.23887 2026-05-14 cs.CR cs.AI 74%

Evaluation of Prompt Injection Defenses in Large Language Models

对大型语言模型中提示注入防御措施的评估

Priyal Deep, Shane Emmons, Amy Fox, Kyle Bacon, Kelley McAllister, Peter Ortiz, Krisztian Flautner

机构 * Swept AI University of Michigan(密歇根大学)

专题命中 提示注入 :prompt injection(title);分类 cs.AI

AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13471 2026-05-14 cs.CR 71%

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

睡眠通道与溯源门:始终在线自主AI代理中的持久提示注入

Narek Maloyan, Dmitry Namiot

专题命中 提示注入 :prompt injection(title)

AI总结 研究提出睡眠通道概念,揭示始终在线AI代理中持久提示注入的机制,并通过层级防御方案和形式化证明提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏