arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 250 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 250 篇

2608.00677 2026-08-04 cs.CL 新提交 83%

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

OpenART:通过开放式环境演化扩展智能体红队演练规模

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) XSafeAI

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究针对现有智能体安全基准无法捕捉累积风险的问题,推出开放式智能体红队演练平台OpenART,并提出EMHA攻击方法,在75种智能体模型配置上实现85.0%的汇总攻击成功率,为复杂环境下的智能体安全研究提供可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11083 2026-06-02 cs.CL 83%

RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates

RedDebate:通过多智能体红队辩论实现更安全的响应

Ali Asad, Stephen Obadinma, Radin Shayanfar, Xiaodan Zhu

机构 * Department of Electrical Computer Engineering \& Ingenuity Labs Research Institute, Queen's University, Kingston, Canada

专题命中 红队测试 :red teaming(title);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出RedDebate框架,利用多智能体辩论和长期记忆模块,通过全自动红队测试减少大语言模型的不安全输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23067 2026-04-28 cs.CR cs.CL 83%

Training a General Purpose Automated Red Teaming Model

训练通用自动化红队模型

Aishwarya Padmakumar, Leon Derczynski, Traian Rebedea, Christopher Parisien

机构 * NVIDIA

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文提出一种通用红队模型训练方法,能适应任意对抗目标,无需依赖预训练评估器,通过微调小模型显著提升生成攻击的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18976 2026-04-22 cs.CL 83%

STAR-Teaming: A Strategy-Response Multiplex Network Approach to Automated LLM Red Teaming

STAR-Teaming:一种基于策略-响应多plex网络的自动化LLM红队方法

MinJae Jung, YongTaek Lim, Chaeyun Kim, Junghwan Kim, Kihyun Kim, Minwoo Kim

机构 * DATUMO INC(DATUMO公司)

专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出STAR-Teaming,一种基于多plex网络的自动化红队方法,通过网络驱动优化生成有效攻击策略,提升LLM策略漏洞的可解释性并降低计算成本。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03699 2026-04-20 cs.CL 83%

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

RedBench:用于大型语言模型全面红队测试的通用数据集

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * Knovel Engineering Lab(Knovel工程实验室) Knovel Engineering Singapore(Knovel工程新加坡) VNU University of Science(越南科学技术大学)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

AI总结 RedBench通过整合37个基准数据集,提供标准化的风险分类和领域框架,用于系统评估大型语言模型的安全性,促进鲁棒性比较和未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08867 2026-04-13 cs.SD cs.AI 83%

AudioGuard: Toward Comprehensive Audio Safety Protection Across Diverse Threat Models

AudioGuard:面向多样化威胁模型的全面音频安全保护

Mintong Kang, Chen Fang, Bo Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.AI

AI总结 本文提出AudioGuard,通过SoundGuard和ContentGuard实现音频安全防护,针对音频特有的风险场景建立首个政策导向的音频安全基准,提升安全防护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18076 2026-01-27 cs.LG 83%

Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming

比较需要有效的测量:重新思考AI红队中的攻击成功率比较

Alexandra Chouldechova, A. Feder Cooper, Solon Barocas, Abhinav Palia, Dan Vann, Hanna Wallach

机构 * Microsoft Research(微软研究院)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.LG

AI总结 本文重新审视AI红队中攻击成功率的比较,指出其有效性问题并提出测量理论和统计学方法以评估比较的合理性。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14195 2026-01-09 cs.LG cs.CR 83%

N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator

N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器

Zheyu Lin, Jirui Yang, Yukui Qiu, Hengqi Guo, Yubing Bao, Yao Guan

机构 * University of California, Riverside(加州大学河滨分校) Fudan University(复旦大学) South China University of Technology(华南理工大学)

专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.LG

AI总结 N-GLARE通过分析潜在表示动态,提出一种高效无输出的大语言模型安全评估方法,显著降低评估成本并提升诊断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15478 2025-11-25 cs.CL 83%

Red Teaming Multimodal Language Models: Evaluating Harm Across Prompt Modalities and Models

针对多模态语言模型的红队测试:评估不同提示模态和模型的有害性

Madison Van Doren, Casey Ford

专题命中 红队测试 :red teaming(title);safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 本研究通过红队测试评估多模态语言模型在不同提示模态下的安全性,发现Pixtral 12B的有害响应率最高,而Claude Sonnet 3.5最安全,凸显了建立多模态安全基准的必要性。

Journal ref AAAI 2026 AIGOV Workshop and EurIPS 2025 Workshop on Unifying Perspectives on Learning Biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11823 2025-10-15 cs.CR cs.AI 83%

BlackIce: A Containerized Red Teaming Toolkit for AI Security Testing

Caelin Kaplan, Alexander Warnecke, Neil Archibald

机构 * Databricks

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06994 2025-10-09 cs.CR cs.CL 83%

RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning

Artur Horal, Daniel Pina, Henrique Paz, Iago Paulo, João Soares, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, João Magalhães, David Semedo

专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17106 2025-05-26 cs.CL 83%

RRTL: Red Teaming Reasoning Large Language Models in Tool Learning

Yifei Liu, Yu Cui, Haibin Zhang

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15754 2025-03-21 cs.CR cs.AI 83%

AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration

Andy Zhou, Kevin Wu, Francesco Pinto, Zhaorun Chen, Yi Zeng, Yu Yang, Shuang Yang, Sanmi Koyejo, James Zou, Bo Li

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01742 2025-03-06 cs.CL 83%

Building Safe GenAI Applications: An End-to-End Overview of Red Teaming for Large Language Models

Alberto Purpura, Sahil Wadhwa, Jesse Zymet, Akshay Gupta, Andy Luo, Melissa Kazemi Rad, Swapnil Shinde, Mohammad Shahed Sorower

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16109 2025-02-25 cs.CL 83%

Be a Multitude to Itself: A Prompt Evolution Framework for Red Teaming

Rui Li, Peiyi Wang, Jingyuan Ma, Di Zhang, Lei Sha, Zhifang Sui

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07238 2025-01-14 cs.AI 83%

Lessons From Red Teaming 100 Generative AI Products

Blake Bullwinkel, Amanda Minnich, Shiven Chawla, Gary Lopez, Martin Pouliot, Whitney Maxwell, Joris de Gruyter, Katherine Pratt, Saphir Qi, Nina Chikanov, Roman Lutz, Raja Sekhar Rao Dheekonda, Bolor-Erdene Jagdagdorj, Eugenia Kim, Justin Song, Keegan Hines, Daniel Jones, Giorgio Severi, Richard Lundeen, Sam Vaughan, Victoria Westerhoff, Pete Bryan, Ram Shankar Siva Kumar, Yonatan Zunger, Chang Kawaguchi, Mark Russinovich

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03876 2024-12-24 cs.CR cs.CL 83%

Automated Progressive Red Teaming

Bojian Jiang, Yi Jing, Tianhao Shen, Tong Wu, Qing Yang, Deyi Xiong

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

Comments Accepted by COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24049 2024-11-28 cs.CL 83%

Desert Camels and Oil Sheikhs: Arab-Centric Red Teaming of Frontier LLMs

Muhammed Saeed, Elgizouli Mohamed, Mukhtar Mohamed, Shaina Raza, Muhammad Abdul-Mageed, Shady Shehata

专题命中 红队测试 :red teaming(title);safety(abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00629 2024-11-27 cs.CL 83%

Against The Achilles' Heel: A Survey on Red Teaming for Generative Models

Lizhi Lin, Honglin Mu, Zenan Zhai, Minghan Wang, Yuxia Wang, Renxi Wang, Junjie Gao, Yixuan Zhang, Wanxiang Che, Timothy Baldwin, Xudong Han, Haonan Li

专题命中 红队测试 :red teaming(title,abstract);harmlessness(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03336 2024-11-08 cs.CR cs.AI 83%

Towards evaluations-based safety cases for AI scheming

Mikita Balesni, Marius Hobbhahn, David Lindner, Alexander Meinke, Tomek Korbak, Joshua Clymer, Buck Shlegeris, Jérémy Scheurer, Charlotte Stix, Rusheb Shah, Nicholas Goldowsky-Dill, Dan Braun, Bilal Chughtai, Owain Evans, Daniel Kokotajlo, Lucius Bushnaq

专题命中 红队测试 :safety(title,abstract);alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23861 2024-11-01 cs.CL cs.MM cs.SD eess.AS 83%

Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models

Hao Yang, Lizhen Qu, Ehsan Shareghi, Gholamreza Haffari

专题命中 红队测试 :red teaming(title);alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04893 2024-03-11 cs.AI 83%

A Safe Harbor for AI Evaluation and Red Teaming

Shayne Longpre, Sayash Kapoor, Kevin Klyman, Ashwin Ramaswami, Rishi Bommasani, Borhane Blili-Hamelin, Yangsibo Huang, Aviya Skowron, Zheng-Xin Yong, Suhas Kotha, Yi Zeng, Weiyan Shi, Xianjun Yang, Reid Southen, Alexander Robey, Patrick Chao, Diyi Yang, Ruoxi Jia, Daniel Kang, Sandy Pentland, Arvind Narayanan, Percy Liang, Peter Henderson

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18789 2026-04-22 cs.AI cs.CR cs.LG 82%

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

ARES: 自适应红队测试与端到端策略-奖励系统修复

Jiacheng Liang, Yao Ma, Tharindu Kumarage, Satyapriya Krishna, Rahul Gupta, Kai-Wei Chang, Aram Galstyan, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊Nova责任AI)

专题命中 红队测试 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 ARES通过自适应红队测试和端到端修复方法,系统发现并缓解策略-奖励系统双重漏洞,提升安全鲁棒性。

Comments 9 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10108 2025-08-15 cs.AI cs.CL 82%

Amazon Nova AI Challenge -- Trusted AI: Advancing secure, AI-assisted software development

Sattvik Sahai, Prasoon Goyal, Michael Johnston, Anna Gottardi, Yao Lu, Lucy Hu, Luke Dai, Shaohua Liu, Samyuth Sagi, Hangjie Shi, Desheng Zhang, Lavina Vaz, Leslie Ball, Maureen Murray, Rahul Gupta, Shankar Ananthakrishna

机构 * Amazon(亚马逊)

专题命中 红队测试 :alignment(abstract);safety(abstract);red teaming(abstract);AI safety(abstract)

Comments 18 pages, 1st Proceedings of Amazon Nova AI Challenge (Trusted AI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31227 2026-07-01 cs.CR 新提交 82%

Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming

保护AI代理:多层代理红队测试的统一框架

Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

专题命中 红队测试 :red teaming(title,abstract);jailbreak(abstract)

AI总结 提出AI-Infra-Guard框架,通过分层攻击面(基础设施、协议/工具、代理行为、模型)匹配不同检测范式,覆盖75+组件和1400+漏洞规则,实现代理安全红队测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05595 2026-04-08 cs.RO cs.CV 82%

Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming

通过多样性感知的红队行动揭示视觉-语言-动作模型中的语言脆弱性

Baoshun Tong, Haoran He, Ling Pan, Yang Liu, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract)

AI总结 本文提出DAERT框架,通过评估统一策略生成多样化挑战性指令,揭示VLA模型在语言变化下的脆弱性,实验显示任务成功率从93.33%降至5.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01592 2026-01-13 cs.CR cs.CV 82%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 红队测试 :red teaming(title);safety(abstract);AI safety(abstract)

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18131 2025-10-22 cs.SE 82%

BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI

Chengquan Guo, Yuzhou Nie, Chulin Xie, Zinan Lin, Wenbo Guo, Bo Li

专题命中 红队测试 :red teaming(title,abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14682 2025-06-18 cs.CR 82%

AIRTBench: Measuring Autonomous AI Red Teaming Capabilities in Language Models

Ads Dawson, Rob Mulla, Nick Landers, Shane Caldwell

专题命中 红队测试 :red teaming(title,abstract);prompt injection(abstract)

Comments 43 pages, 13 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04249 2024-02-28 cs.LG cs.AI cs.CL cs.CV 82%

HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal

Mantas Mazeika, Long Phan, Xuwang Yin, Andy Zou, Zifan Wang, Norman Mu, Elham Sakhaee, Nathaniel Li, Steven Basart, Bo Li, David Forsyth, Dan Hendrycks

专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Website: https://www.harmbench.org

详情

展开后加载摘要…

URL PDF HTML 收藏