arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 250 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 250 篇

2408.11851 2024-08-23 cs.AI cs.CL cs.CR 92%

SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming

Anurakt Kumar, Divyanshu Kumar, Jatan Loya, Nitin Aravind Birur, Tanay Baswa, Sahil Agarwal, Prashanth Harshangi

专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04806 2025-05-14 cs.CR cs.CL 92%

Red Teaming the Mind of the Machine: A Systematic Evaluation of Prompt Injection and Jailbreak Vulnerabilities in LLMs

Chetan Pathade

机构 * Independent Researcher(独立研究者)

专题命中 红队测试 :jailbreak(title,abstract);prompt injection(title,abstract);red teaming(title);alignment(abstract)

Comments 7 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10589 2026-01-16 cs.CR cs.CL 90%

Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay

做自己的红队:通过自play和反思经验回放实现安全对齐

Hao Wang, Yanting Wang, Hao Li, Rui Li, Lei Sha

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);red teaming(abstract)

AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08676 2024-06-25 cs.CL cs.CY cs.LG 90%

ALERT: A Comprehensive Benchmark for Assessing Large Language Models' Safety through Red Teaming

Simone Tedeschi, Felix Friedrich, Patrick Schramowski, Kristian Kersting, Roberto Navigli, Huu Nguyen, Bo Li

专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG

Comments 17 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09624 2023-11-14 cs.CL cs.AI cs.LG 90%

ASSERT: Automated Safety Scenario Red Teaming for Evaluating the Robustness of Large Language Models

Alex Mei, Sharon Levy, William Yang Wang

专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments In Findings of the 2023 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03265 2026-01-08 cs.CL cs.CR cs.LG 90%

Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models

Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径

Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh, David Zhang, Eric Hsin, Li Chen, Ankit Jain, Matt Fredrikson, Akash Bharadwaj

机构 * Meta Superintelligence Labs(Meta超智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。

Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05407 2026-07-08 cs.CY cs.AI 新提交 90%

Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

立场:防止人工智能生成的儿童性虐待材料需要新的人工智能安全方法

Neil Kale, Rebecca Portnoff, Pratiksha Thaker, Michael Simpson, Robertson Wang, Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Thorn

专题命中 红队测试 :safety(title,abstract);AI safety(title,abstract);red teaming(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能给儿童安全带来的新风险,指出保护儿童免受其助长的性虐待需新安全方法。探讨现有技术与相关约束的不兼容及带来的挑战,概述15个开放性问题并给出针对性建议,推动将负责任AI原则转化为儿童保护措施。

Comments Accepted (spotlight) in ICML 2026, Position Paper Track. The first two authors contributed equally and may list their names interchangeably

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15050 2024-07-23 cs.LG cs.AI cs.CR cs.MM 90%

Arondight: Red Teaming Large Vision Language Models with Auto-generated Multi-modal Jailbreak Prompts

Yi Liu, Chengjun Cai, Xiaoli Zhang, Xingliang Yuan, Cong Wang

专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);safety(abstract);分类 cs.AI、cs.LG

Comments To be published in ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05376 2025-06-10 cs.CR cs.AI 89%

A Red Teaming Roadmap Towards System-Level Safety

Zifan Wang, Christina Q. Knight, Jeremy Kritz, Willow E. Primack, Julian Michael

专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13581 2024-05-24 cs.CV cs.AI 89%

Safety Alignment for Vision Language Models

Zhendong Liu, Yuanbi Nie, Yingshui Tan, Xiangyu Yue, Qiushi Cui, Chongjun Wang, Xiaoyong Zhu, Bo Zheng

专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);red teaming(abstract);分类 cs.AI

Comments 23 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09974 2025-09-18 cs.CR cs.AI 89%

Analysing Safety Risks in LLMs Fine-Tuned with Pseudo-Malicious Cyber Security Data

Adel ElZemity, Budi Arief, Shujun Li

机构 * University of Kent(肯特大学)

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00027 2026-06-02 cs.CL cs.AI 88%

A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models

医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架

Andrei Marian Feier, Veysel Kocaman, Yigit Gul, Ahmet Korkmaz, Alexander Thomas, Aleksei Zakharov, Jay Gil, Mehmet Butgul, David Talby

机构 * John Snow Labs Inc.(约翰·索克斯实验室公司)

专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一个多领域红队框架,通过690个临床场景评估11个当代大语言模型,发现平均准确率掩盖了临床意义上的风险,性能方差和最坏情况失败比平均准确率更能反映可靠性,混合评估方法对可信安全评估至关重要。

Comments 10 pages, 4 figures. To be presented at the Text2Story 2026 Workshop (Delft, The Netherlands, 29 March 2026); CEUR Workshop Proceedings (forthcoming). Affiliation: John Snow Labs Inc

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14651 2025-09-19 cs.CL cs.AI 88%

MUSE: MCTS-Driven Red Teaming Framework for Enhanced Multi-Turn Dialogue Safety in Large Language Models

Siyu Yan, Long Zeng, Xuecheng Wu, Chengcheng Han, Kongcheng Zhang, Chong Peng, Xuezhi Cao, Xunliang Cai, Chenjuan Guo

机构 * East China Normal University(东华大学) Xi’an Jiaotong University(西安交通大学) Meituan(美团) Zhejiang University(浙江大学)

专题命中 红队测试 :safety(title,abstract);red teaming(title);alignment(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04856 2025-08-06 cs.CL cs.AI 88%

M2S: Multi-turn to Single-turn jailbreak in Red Teaming for LLMs

Junwoo Ha, Hyunjun Kim, Sangyoon Yu, Haon Park, Ashkan Yousefpour, Yuna Park, Suhyun Kim

机构 * AIM Intelligence(AIM智能研究所) University of Seoul(首尔大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Seoul National University(首尔国立大学) Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) Kyung Hee University(庆熙大学)

专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 (Main Track). Camera-ready version

Journal ref Proc. ACL 2025 (Vol. 1: Long Papers), pp. 16489-16507, Vienna, Austria, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03411 2024-12-17 cs.LG cs.CL cs.CR 88%

Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?

Shuo Chen, Zhen Han, Bailan He, Zifeng Ding, Wenqian Yu, Philip Torr, Volker Tresp, Jindong Gu

专题命中 红队测试 :jailbreak(title,abstract);red teaming(title);safety(abstract);分类 cs.CL、cs.LG

Comments technical report; update code repo link

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09701 2026-06-09 cs.CL cs.AI cs.LG 新提交 88%

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

学习攻击与防御:通过GRPO对语言模型进行自适应红队测试

Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

机构 * Microsoft AI Red Team(微软AI红队) Microsoft Azure(微软Azure)

专题命中 红队测试 :red teaming(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03693 2023-10-06 cs.CL cs.AI cs.CR cs.LG 88%

Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!

Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, Peter Henderson

专题命中 红队测试 :safety(title,abstract);alignment(abstract);jailbreak(abstract);red teaming(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14202 2025-07-22 cs.CR cs.AI 88%

PRM-Free Security Alignment of Large Models via Red Teaming and Adversarial Training

Pengfei Du

机构 * Pengfei Du(独立研究者)

专题命中 红队测试 :alignment(title,abstract);red teaming(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10253 2024-06-28 cs.AI 88%

GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts

Jiahao Yu, Xingwei Lin, Zheng Yu, Xinyu Xing

专题命中 红队测试 :jailbreak(title,abstract);red teaming(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY 87%

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19476 2024-10-01 cs.CL cs.CR 87%

Overriding Safety protections of Open-source Models

Sachin Kumar

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02510 2026-07-03 cs.AI cs.CL cs.LG stat.AP stat.ML 新提交 87%

Online Safety Monitoring for LLMs

LLMs的在线安全监控

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15361 2024-09-25 cs.CL cs.AI cs.LG 87%

Multitask Mayhem: Unveiling and Mitigating Safety Gaps in LLMs Fine-tuning

Essa Jan, Nouar AlDahoul, Moiz Ali, Faizan Ahmad, Fareed Zaffar, Yasir Zaki

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07695 2026-07-09 cs.AI cs.GT cs.MA 新提交 86%

Institutional Red-Teaming: Deployment Rules, Not Just Models, Causally Shape Multi-Agent AI Safety

机构红队测试:部署规则而非模型,因果性地塑造多智能体人工智能安全

Yujiao Chen

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 红队测试 :safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 研究多智能体人工智能安全中部署规则的影响,提出机构红队测试方法,通过IABench-CA实例化,发现规则改变集体安全、无安全默认规则、身份显著性是机制,还打包成安全案例工作流程认证规则区域并明确风险义务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20411 2025-08-29 cs.AI cs.CR cs.CY 86%

Governable AI: Provable Safety Under Extreme Threat Models

Donglin Wang, Weiyun Liang, Chunyuan Chen, Jing Xu, Yulong Fu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) Sursen Corp.(苏尔森公司) China Academy of Electronics and Information Technology(中国电子信息技术研究院)

专题命中 红队测试 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06843 2025-05-27 cs.LG cs.CL 86%

Benign Samples Matter! Fine-tuning On Outlier Benign Samples Severely Breaks Safety

Zihan Guan, Mengxuan Hu, Ronghang Zhu, Sheng Li, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) University of Georgia(佐治亚大学)

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.LG

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18041 2025-04-28 cs.CL cs.AI 86%

RAG LLMs are Not Safer: A Safety Analysis of Retrieval-Augmented Generation for Large Language Models

Bang An, Shiyue Zhang, Mark Dredze

机构 * Bloomberg AI(布莱尔人工智能) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 红队测试 :safety(title,abstract);red teaming(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16667 2024-07-24 cs.CR cs.AI cs.CL 86%

RedAgent: Red Teaming Large Language Models with Context-aware Autonomous Language Agent

Huiyu Xu, Wenhui Zhang, Zhibo Wang, Feng Xiao, Rui Zheng, Yunhe Feng, Zhongjie Ba, Kui Ren

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12915 2024-01-24 cs.AI cs.CL cs.CV 86%

Red Teaming Visual Language Models

Mukai Li, Lei Li, Yuwei Yin, Masood Ahmed, Zhenguang Liu, Qi Liu

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05108 2026-08-06 cs.CR 新提交 86%

Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统

Yanting Wang, Chenlong Yin, Runpeng Geng, Jinyuan Jia

专题命中 红队测试 :prompt injection(title,abstract);red teaming(title)

AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。

Comments Our code is available at https://github.com/wang-yanting/PIMiner

详情

展开后加载摘要…

URL PDF HTML 收藏