Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
保护AI代理:多层代理红队测试的统一框架
专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract)
AI总结 提出AI-Infra-Guard框架,通过分层攻击面(基础设施、协议/工具、代理行为、模型)匹配不同检测范式,覆盖75+组件和1400+漏洞规则,实现代理安全红队测试。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
保护AI代理:多层代理红队测试的统一框架
专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract)
AI总结 提出AI-Infra-Guard框架,通过分层攻击面(基础设施、协议/工具、代理行为、模型)匹配不同检测范式,覆盖75+组件和1400+漏洞规则,实现代理安全红队测试。
大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题
机构 * Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 红队测试 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.AI
AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。
面向AI原生世界的计算机科学课程中的AI韧性评估
机构 * Rice University(莱斯大学)
专题命中 红队测试 :red teaming(abstract);分类 cs.AI、cs.CY
AI总结 提出基于帕累托盈余的AI韧性评估框架,通过可执行评估器衡量学生超越AI基线的能力,并应用于Bloom过滤器作业实例。
Stable-GFlowNet: 通过对比轨迹平衡实现多样且鲁棒的LLM红队测试
机构 * Naver AI Lab(Naver AI实验室)
专题命中 红队测试 :safety(abstract);分类 cs.LG
AI总结 针对大语言模型红队测试中有效性与多样性难以兼顾的问题,提出Stable-GFlowNet方法,通过消除配分函数估计和对比轨迹平衡实现稳定训练,在保持最优策略的同时提升攻击性能与多样性。
Comments ICML 2026 Spotlight