arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-20 至 2026-05-20 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2601.22569 2026-05-20 cs.CR cs.AI 79%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25448 2026-05-20 cs.CR cs.CL 79%

Fingerprinting LLMs via Prompt Injection

通过提示注入指纹化LLM

Yuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong, Neil Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出LLMPrint框架,通过利用LLM对提示注入的固有脆弱性来构建指纹,以解决已发布模型的溯源问题,其核心方法是优化提示以获得唯一且抗后处理的指纹,实验显示其在高召回率下保持低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18918 2026-05-20 cs.CR cs.AI 70%

ESLD (External Surrogate Latent Defense): A Latent-Space Architecture for Faster, Stronger Prompt-Injection Defense

ESLD (外部代理潜在防御):一种用于更快、更强提示注入防御的潜在空间架构

Yash Narendra

机构 * Microsoft(微软)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种名为ESLD的潜在空间架构,通过利用守卫模型内部表示中的信号来加速安全检查并提高检测准确性,无需重新训练或修改守卫模型。

详情

展开后加载摘要…

URL PDF HTML 收藏