arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2604.28157 2026-05-01 cs.CR 78%

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

FlashRT: 向计算和内存高效方向发展用于提示注入和知识腐败的红队测试

Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出FlashRT框架,通过提升计算和内存效率,优化长上下文LLM的提示注入和知识腐败攻击,实现2-7倍的加速和2-4倍的内存节省,为系统评估长上下文LLM的安全性提供工具。

Comments The code is available at https://github.com/Wang-Yanting/FlashRT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27202 2026-05-01 cs.CR 78%

Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives

野外间接提示注入:网页中间接提示注入的实证研究

Soheil Khodayari, Xuenan Zhang, Bhupendra Acharya, Giancarlo Pellegrino

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究通过分析网页和HTTP响应中的间接提示注入实例,揭示其在真实环境中的普遍存在性、技术手段及影响,发现大部分指令针对机器而非人类,且存在多种不同的目标和影响。

Comments 18 pages total, 12 pages main content, 8 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏