arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06393 2026-05-08 cs.CR 50%

Constraining Host-Level Abuse in Self-Hosted Computer-Use Agents via TEE-Backed Isolation

通过TEE后置隔离约束自托管计算机使用代理的主机级滥用

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出基于操作的风险约束模型,通过TEE后置可信操作平面保护关键安全功能,实现对自托管计算机使用代理操作的安全限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03117 2026-05-08 cs.CR 50%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏