Runtime Compliance Verification for AI Agents
AI代理的运行时合规性验证
专题命中 红队测试 :red teaming(abstract)
AI总结 提出C-Trace框架,通过运行时监控和形式化策略谓词,确保AI代理在工具调用和对话中遵守GDPR规则,将攻击成功率降至12%以下。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AI代理的运行时合规性验证
专题命中 红队测试 :red teaming(abstract)
AI总结 提出C-Trace框架,通过运行时监控和形式化策略谓词,确保AI代理在工具调用和对话中遵守GDPR规则,将攻击成功率降至12%以下。
从新手到专家:利用LLMs实现企业软件自动漏洞利用
专题命中 红队测试 :safety(abstract)
AI总结 本文展示如何利用公开的LLMs将新手转变为具备攻击能力的用户,提出RSA策略以绕过安全机制,验证了LLMs在漏洞利用中的有效性,挑战了传统安全原则。
通过种群化扩大大型语言模型毒性搜索
专题命中 红队测试 :red teaming(abstract)
AI总结 本文提出ToxSearch-S,通过种群化方法在大型语言模型中扩展毒性搜索,提高毒性峰值并扩大语义覆盖范围,同时在嵌入空间中形成行为差异化的niche。
Comments Preprint. 4 pages, Accepted at GECCO as short paper
专题命中 红队测试 :safety(abstract)
专题命中 红队测试 :alignment(abstract)
Comments AEAS has been implemented in the planning agent of PentestAgent, our LLM-driven automated penetration testing framework. Check out our repository: https://github.com/nbshenxm/pentest-agent
专题命中 红队测试 :safety(abstract)
专题命中 红队测试 :safety(abstract)
专题命中 红队测试 :prompt injection(abstract)
专题命中 红队测试 :safety(abstract)
专题命中 红队测试 :safety(abstract)
Comments To appear in IEEE Embedded Systems Letters