arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2604.25562 2026-04-29 cs.CR cs.AI 79%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22040 2026-04-29 cs.CR cs.SE 78%

"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors

你的AI,我的Shell:解密面向代理AI编码编辑器的提示注入攻击

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究分析了高权限代理AI编码编辑器的提示注入攻击,通过AIShellJack框架测试,发现攻击成功率高达84%,可实现从初始访问到数据外泄的多种攻击目标。

详情

展开后加载摘要…

URL PDF HTML 收藏