arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 4 篇

2604.11806 2026-04-14 cs.AI cs.CL 84%

Detecting Safety Violations Across Many Agent Traces

在大量智能体轨迹中检测安全违规

Adam Stein, Davis Brown, Hamed Hassani, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 提示注入 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Meerkat方法,通过聚类与智能体搜索结合,有效发现自然语言指定的安全违规,提升检测效率并发现广泛开发者作弊和奖励黑客行为。

Comments 35 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22830 2026-04-14 cs.CL 79%

ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents

ChatInject: 利用聊天模板对LLM代理进行提示注入

Hwan Chang, Yonghyun Jun, Hwanhee Lee

机构 * Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 研究提出ChatInject攻击,通过模拟聊天模板诱导LLM代理执行恶意指令,实验显示其攻击成功率显著高于传统方法,且现有防御措施对多轮对话变种效果有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06436 2026-04-14 cs.CR cs.AI 79%

The Defense Trilemma: Why Prompt Injection Defense Wrappers Fail?

防御三重困境:为何提示注入防御包装失效?

Manish Bhatt, Sarthak Munshi, Vineeth Sai Narajala, Idan Habler, Ammar Al-Kahfah, Ken Huang, Joel Webb, Blake Gatto, Md Tamjidul Hoque

机构 * OWASP Amazon Leo UNO Amazon Web Services(亚马逊云服务) Cisco(思科) Shrewd Security

专题命中 提示注入 :prompt injection(title);alignment(abstract);分类 cs.AI

AI总结 研究证明连续且保持效用的防御包装无法使语言模型的所有输出严格安全,并揭示了防御必须失败的精确位置。通过三个逐步加强的假设,证明了连续性、效用保持性和完整性无法共存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10134 2026-04-14 cs.CR 78%

PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification

PlanGuard:通过基于规划的一致性验证防御代理 against 间接提示注入

Guangyu Gong, Zizhuang Deng

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出PlanGuard,一种基于上下文隔离的无训练防御框架,通过规划器生成有效动作集和分层验证机制,有效防御间接提示注入攻击,实验显示攻击成功率从72.8%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏