Red Teaming with Mind Reading: White-Box Adversarial Policies Against RL Agents
专题命中 红队测试 :red teaming(title);分类 cs.AI、cs.LG
Comments Code is available at https://github.com/thestephencasper/lm_white_box_attacks
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 红队测试 :red teaming(title);分类 cs.AI、cs.LG
Comments Code is available at https://github.com/thestephencasper/lm_white_box_attacks
专题命中 红队测试 :red teaming(title);分类 cs.AI、cs.LG
Comments In Proceedings of the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)
专题命中 红队测试 :red teaming(title);分类 cs.AI、cs.LG
它们会走多远?使用大型语言模型对在线影响力进行红队测试
机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)
专题命中 红队测试 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。
Comments 30 pages, 8 figures, submitted to COLM 2026
机构 * University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 红队测试 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 红队测试 :jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 红队测试 :jailbreak(abstract);red teaming(abstract);分类 cs.CL、cs.CY、cs.LG
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI;red teaming(comments)
Comments Paper at NeurIPS 2024 Workshop on Red Teaming GenAI
OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 红队测试 :red teaming(title);分类 cs.LG
AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。
Comments Accepted to ICML 2026
RedCoder: 面向代码大语言模型的自动化多轮红队测试
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Southern California(南加州大学)
专题命中 红队测试 :red teaming(title);分类 cs.AI
AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。
Comments ACL 2026
专题命中 红队测试 :red teaming(title);分类 cs.LG
Comments An earlier version first published in Good Practices and New Perspectives in Information Systems and Technologies (pp. 129-138), 2024 by Springer Nature
数据工作能否具有修复性?
机构 * University of Edinburgh(爱丁堡大学) ; Google Research(谷歌研究院)
专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI、cs.CY
AI总结 通过民族志研究,探讨公民科技倡议如何从女性主义视角协作构建安全数据集,旨在将数据工作重塑为修复与补救的场所,并分析其中遇到的挑战与张力。
Comments To be presented at ACM FAccT, Montréal, Canada, June 25 to June 28, 2026
SafeSearch: 基于LLM的搜索代理的自动化红队测试
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 红队测试 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。
Comments Accepted by ICML 2026
ADR:一种用于企业代理AI安全的代理检测系统
机构 * Uber
专题命中 红队测试 :red teaming(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。
Comments Accepted at MLSys 2026 (Industry Track)
PersonaTeaming: 支持基于人设的生成AI红队测试
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Apple(苹果公司)
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出PersonaTeaming方法,通过整合人设提升红队测试的自动化与人机协作能力,实验显示其在攻击成功率和提示多样性方面优于现有方法,并通过用户界面促进人机协同创新。
在Veo世界模拟器中评估Gemini机器人策略
机构 * Gemini Robotics Team(Gemini机器人团队) ; Google DeepMind(谷歌DeepMind)
专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出基于Veo视频模型的生成式评估系统,用于在Veo世界模拟器中全面评估Gemini机器人策略的性能,包括名义性能、分布外泛化及安全约束测试。
机构 * Scale AI ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 红队测试 :red teaming(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
Comments 18 pages, 15 figures
机构 * University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学) ; Cornell University(康奈尔大学) ; Anthropic ; Oregon State University(俄勒冈州立大学) ; Google DeepMind(谷歌DeepMind) ; ETH Zurich(苏黎世联邦理工学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments IEEE S&P 2025
专题命中 红队测试 :red teaming(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
将代理笼中:面向医疗AI自主系统的零信任安全架构
机构 * VP of Trust, Commure(Commure 职务负责人) ; Founder & CEO, nFactor Technologies(nFactor Technologies 创始人及首席执行官)
专题命中 红队测试 :prompt injection(abstract,comments);red teaming(abstract);分类 cs.AI
AI总结 本文提出零信任安全架构,用于医疗AI自主代理,通过多层防御机制解决代理在医疗环境中存在的关键安全漏洞,包括凭证泄露、执行能力滥用等,并开源相关配置和工具。
Comments Keywords: agentic AI security, autonomous agents, healthcare cybersecurity, zero trust, prompt injection, HIPAA, Kubernetes security, OpenClaw
针对代码任务定制化大语言模型的突破:针对指令后门攻击的自动红队测试
专题命中 红队测试 :red teaming(title)
AI总结 本文提出ARIA自动红队测试框架,可高效生成针对代码定制化LLM的隐蔽带后门指令,攻击成功率达0.945且规避检测能力强,性能优于现有基线攻击。
Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026
AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试
专题命中 红队测试 :red teaming(title)
AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。
Comments Work in progress
SkillAttack:通过攻击路径细化实现对代理技能的自动化红队测试
专题命中 红队测试 :red teaming(title)
AI总结 本文提出SkillAttack框架,通过对抗性提示动态验证技能漏洞可利用性,实验显示其在对抗性技能和真实场景中均显著优于基线方法,揭示了即使善意技能在实际代理交互中也存在严重安全风险。
模型上下文协议威胁建模及针对提示注入的漏洞分析
专题命中 红队测试 :prompt injection(title)
AI总结 本文基于STRIDE和DREAD框架对MCP五个关键组件进行威胁建模,发现工具污染是主要客户端漏洞,提出多层防御策略以提升AI代理生态的安全性。
专题命中 红队测试 :red teaming(title)
专题命中 红队测试 :red teaming(title)
Comments 15 pages, 6 figures
人工智能红队评估能证明什么以及不能证明什么
机构 * APIsec Research Labs(APIsec研究实验室)
专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI
AI总结 研究人工智能红队评估能证与不能证之事,通过定义证据上限确定界限,发现高于某危害率基准可证类别,低于则否,该界限不限于基准,审核评估套件发现当前基准对高频危害足够,对罕见灾难性不足。
Comments 21 pages, 4 figures, 5 tables. Code and data links provided in the manuscript. v2: corrected Figure 1(b); corrected required sample sizes in Table 4 and in Sections 4.2, 4.6 and 5.2, which had been rounded rather than taken to the ceiling; corrected the sample-size expression stated in Methods; minor corrections to Table 1 and the Figure 2 caption. No theorem, result or conclusion is affected
立场:人工智能/机器学习领域对深度伪造的研究与人工智能生成的非自愿亲密图像(AIG-NCII)不一致
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究指出人工智能/机器学习领域对深度伪造的研究与AIG-NCII不一致,现有技术干预忽略AIG-NCII,现有干预只关注观众认知危害,忽略主体尊严危害,建议更新威胁模型,在安全研究中解决AIG-NCII,同时警告研究人员涉足该领域需谨慎并做好防护。
Comments ICML 2026. Outstanding position paper honorable mention
模糊任务上的扩散AI控制
机构 * Anthropic Fellows Program (via MATS)(Anthropic 研究员计划(通过 MATS)) ; EPFL(洛桑联邦理工学院) ; Redwood Research(红木研究) ; Anthropic
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.LG
AI总结 针对AI在模糊任务上的长期扩散威胁,提出蓝队与红队对抗框架,通过弱模型评分训练强模型,并发现红队可利用多目标进化提示优化找到评分高但性能差的子版本行为,蓝队则通过对抗优化提升鲁棒性。
超越通过/失败:使用过程挖掘理解LLM如何抵抗(和失败)红队攻击
机构 * MuyVentive LLC
专题命中 红队测试 :jailbreak(abstract);red teaming(abstract);分类 cs.AI
AI总结 提出将过程挖掘应用于红队攻击轨迹,通过分析事件日志提取直接跟随图和状态转移矩阵,揭示GPT-OSS和Llama 3.3在防御结构上的差异,发现传统攻击成功率指标无法捕捉的模型防御模式。