arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-10 至 2026-06-10 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2606.10525 2026-06-10 cs.CR cs.AI 新提交 83%

Assessing Automated Prompt Injection Attacks in Agentic Environments

评估智能体环境中的自动化提示注入攻击

David Hofer, Edoardo Debenedetti, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 79%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏