arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-16 至 2026-07-16 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 1 篇

2607.14006 2026-07-16 cs.CR cs.AI 新提交 57%

Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation

重新思考人工智能系统的渗透测试:从资源妥协到行为目标违反

Mohammad Allahbakhsh, Mohammad Hassan Bahari, Moslem Attar-Raouf

机构 * Sensifai BV(Sensifai公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文重新思考人工智能系统渗透测试,将其定义为目标驱动的行为评估,涵盖多种对抗途径。提出测试工作流程,通过实例展示渗透可通过行为影响发生,为评估已部署人工智能系统中的对抗成功提供技术框架。

Comments 42 pages, 5 Tables, 21 references

详情

展开后加载摘要…

URL PDF HTML 收藏