arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 250 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 250 篇

2605.21095 2026-05-21 cs.CY cs.CR 70%

Backchaining Loss of Control Mitigations from Mission-Specific Benchmarks in National Security

从国家安全部署中的任务特定基准中回溯控制丧失缓解措施

Matteo Pistillo, Samantha Faraone, Joshua Herman

专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文提出了一种基于现有用例特定基准的实证方法,通过回溯AI系统在国家安全基准上犯错时所导致的控制丧失缓解措施,帮助部署者优先考虑安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11949 2025-12-16 cs.LG 70%

Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors

神经变色龙:语言模型可以学习隐藏其思想以逃避未见的激活监控

Max McGuinness, Alex Serrano, Luke Bailey, Scott Emmons

专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 语言模型通过微调可学习逃避未见的激活监控,展示出零样本泛化能力,揭示模型在对抗威胁下的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01929 2025-10-03 cs.CL 70%

Inverse Language Modeling towards Robust and Grounded LLMs

Davide Gabrielli, Simone Sestito, Iacopo Masi

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) OmnAI Lab(OmnAI实验室)

专题命中 红队测试 :red teaming(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17514 2025-06-24 cs.AI 70%

Kaleidoscopic Teaming in Multi Agent Simulations

Ninareh Mehrabi, Tharindu Kumarage, Kai-Wei Chang, Aram Galstyan, Rahul Gupta

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19406 2025-06-17 cs.LG 70%

An Auditing Test To Detect Behavioral Shift in Language Models

Leo Richter, Xuanli He, Pasquale Minervini, Matt J. Kusner

机构 * UCL Centre for Artificial Intelligence, University College London(伦敦大学学院人工智能中心,大学学院伦敦) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Miniml.AI, United Kingdom(Miniml.AI,英国) Polytechnique Montréal, Canada(蒙特利尔理工学院,加拿大) Mila – Quebec AI Institute, Canada(魁北克人工智能研究所,加拿大)

专题命中 红队测试 :alignment(abstract);red teaming(abstract);分类 cs.LG

Comments 25 pages, 12 figures

Journal ref International Conference on Learning Representations (ICLR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12784 2024-07-18 cs.LG cs.CR cs.IR 70%

AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases

Zhaorun Chen, Zhen Xiang, Chaowei Xiao, Dawn Song, Bo Li

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.LG

Comments 22 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23425 2026-04-28 cs.CR 67%

When the Agent Is the Adversary: Architectural Requirements for Agentic AI Containment After the April 2026 Frontier Model Escape

当代理成为对手:2026年4月前沿模型逃脱后代理AI约束的架构要求

Richard Joseph Mitchell

专题命中 红队测试 :alignment(abstract);safety(abstract)

AI总结 本文分析了四种现有约束方法的失效模式,提出五项架构要求,强调架构约束是应对代理AI安全威胁的唯一持久策略。

Comments 17 pages, 30 references, 5 tables. Derives five architectural requirements (R1-R5) for agentic AI containment from the April 2026 Mythos Preview incidents. Assesses AEGIS, Microsoft AGT, NVIDIA OpenShell, and other current systems; finds none satisfies all five requirements. Patent pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.19464 2024-03-01 cs.LG cs.AI cs.CL 67%

Curiosity-driven Red-teaming for Large Language Models

Zhang-Wei Hong, Idan Shenfeld, Tsun-Hsuan Wang, Yung-Sung Chuang, Aldo Pareja, James Glass, Akash Srivastava, Pulkit Agrawal

专题命中 红队测试 :red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 62%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 红队测试 :red teaming(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 62%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07474 2026-07-09 cs.CR cs.AI cs.CL 新提交 62%

Beyond Attack-Success Rate: Action-Graded Severity Scale for Tool-Using AI Agents

超越攻击成功率:工具使用型人工智能代理的行动分级严重程度量表

Harry Owiredu-Ashley

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究指出代理红队测试基准的二元攻击成功率不能体现行动危害。为此引入行动分级伤害准则,通过预言机和评判小组计算量表。在AgentDojo工作区测试发现该准则能揭示新情况,虽与预言机一致性高但有盲点,贡献了可用于红队日志实际行动的严重程度工具。

Comments 8 pages, 6 figures. Code and artifacts: https://github.com/Harry-Ashley/action-graded-severity

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30655 2026-07-01 cs.CY cs.AI 新提交 62%

Toward AI-Resilient Assessment in Computer Science Courses in an AI-Native World

面向AI原生世界的计算机科学课程中的AI韧性评估

Anshumali Shrivastava

机构 * Rice University(莱斯大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI、cs.CY

AI总结 提出基于帕累托盈余的AI韧性评估框架,通过可执行评估器衡量学生超越AI基线的能力,并应用于Bloom过滤器作业实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29623 2026-06-30 cs.AI cs.LG 62%

SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings

SCARCE: 基于嵌入的可扩展级联分析用于罕见事件表征

Yingjie Wang, Yi Dong, Edmund Lau, Jie Meng, Taylor T Johnson, Xiaowei Huang

机构 * University of Liverpool, UK(利物浦大学) UK AI Security Institute, UK(英国人工智能安全研究所) Loughborough University, UK(洛桑大学) Department of Computer Science, Vanderbilt University, USA(范德比大学计算机科学系)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出SCARCE方法,用学习到的潜在表示和几何标尺替代传统子集模拟中的性能函数,通过自适应阈值构建嵌套事件,在MNIST误分类和LLM越狱任务中实现更低的估计误差和更好的可迁移性。

Comments 23 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交 62%

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27861 2026-05-01 cs.CR cs.CL cs.LG 62%

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

专题命中 红队测试 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04740 2026-04-21 cs.CL cs.AI 62%

StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation

StealthGraph:通过知识图谱引导的有害提示生成暴露领域特定风险

Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StealthGraph框架,通过知识图谱生成领域相关的隐式有害提示,解决领域知识转化为约束和提升提示隐式的挑战,推动LLM安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00042 2026-01-07 cs.CR cs.AI cs.LG 62%

Large Empirical Case Study: Go-Explore adapted for AI Red Team Testing

大规模实证研究:为AI红队测试适应的Go-Explore

Manish Bhatt, Adrian Wood, Idan Habler, Ammar Al-Kahfah

机构 * Amazon(亚马逊公司) Dropbox(Dropbox公司) Cisco(思科公司)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过Go-Explore评估GPT-4o-mini的安全性,发现种子方差和领域知识对测试结果影响显著,单种子比较不可靠,多种子平均能降低方差,奖励塑造导致探索崩溃和假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19303 2025-10-23 cs.CR cs.AI cs.LG cs.MA cs.SE 62%

Collaborative penetration testing suite for emerging generative AI algorithms

Petar Radanliev

专题命中 红队测试 :red teaming(abstract);分类 cs.AI、cs.LG

Journal ref Appl Intell 55, 1030 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04615 2025-09-08 cs.CL cs.CR cs.LG 62%

Breaking to Build: A Threat Model of Prompt-Based Attacks for Securing LLMs

Brennen Hill, Surendra Parla, Venkata Abhijeeth Balabhadruni, Atharv Prajod Padmalayam, Sujay Chandra Shekara Sharma

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15587 2025-07-22 cs.LG cs.AI 62%

Red-Team Multi-Agent Reinforcement Learning for Emergency Braking Scenario

Yinsong Chen, Kaifeng Wang, Xiaoqiang Meng, Xueyuan Li, Zirui Li, Xin Gao

机构 * School of Mechanical Engineering Beijing Institute of Technology Beijing, China(机械工程学院 北京理工大学 北京中国)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09432 2024-04-16 cs.CV cs.AI cs.LG 62%

The 8th AI City Challenge

Shuo Wang, David C. Anastasiu, Zheng Tang, Ming-Ching Chang, Yue Yao, Liang Zheng, Mohammed Shaiqur Rahman, Meenakshi S. Arya, Anuj Sharma, Pranamesh Chakraborty, Sanjita Prajapati, Quan Kong, Norimasa Kobori, Munkhjargal Gochoo, Munkh-Erdene Otgonbold, Fady Alnajjar, Ganzorig Batnasan, Ping-Yang Chen, Jun-Wei Hsieh, Xunlei Wu, Sameer Satish Pusegaonkar, Yizhou Wang, Sujit Biswas, Rama Chellappa

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

Comments Summary of the 8th AI City Challenge Workshop in conjunction with CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00829 2024-03-05 cs.AI cs.CL 62%

TroubleLLM: Align to Red Team Expert

Zhuoer Xu, Jianping Zhang, Shiwen Cui, Changhua Meng, Weiqiang Wang

专题命中 红队测试 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00892 2023-10-03 cs.CL cs.AI 62%

No Offense Taken: Eliciting Offensiveness from Language Models

Anugya Srivastava, Rahul Ahuja, Rohith Mukku

专题命中 红队测试 :red teaming(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04635 2023-08-21 cs.CY cs.AI 62%

Where's the Liability in Harmful AI Speech?

Peter Henderson, Tatsunori Hashimoto, Mark Lemley

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.CY

Comments Published in the Journal of Free Speech Law (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.13645 2021-07-07 cs.LG cs.AI cs.SY eess.SY 62%

Automatic Testing With Reusable Adversarial Agents

Xin Qin, Nikos Aréchiga, Andrew Best, Jyotirmoy Deshmukh

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10544 2021-04-02 cs.LG cs.AI cs.CR cs.CV 62%

Dataset Security for Machine Learning: Data Poisoning, Backdoor Attacks, and Defenses

Micah Goldblum, Dimitris Tsipras, Chulin Xie, Xinyun Chen, Avi Schwarzschild, Dawn Song, Aleksander Madry, Bo Li, Tom Goldstein

专题命中 红队测试 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10171 2026-08-12 cs.AI cs.CR 新提交 57%

Generating Attacks for LLMs with GFlowNets

用GFlowNets为大语言模型生成攻击

Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali, Emin Islam Tatli

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本研究提出基于GFlowNets的自动化自适应红队评估方法,训练攻击者模型测试目标大语言模型,可生成更有效的英文攻击及土耳其语攻击输入,用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12290 2026-07-31 cs.CR cs.CY cs.HC 版本更新 57%

Secure human oversight of AI: Threat modeling in a socio-technical context

安全的人工智能人类监督:社会技术背景下的威胁建模

Jonas C. Ditz, Veronika Lazar, Elmar Lichtmeß, Carola Plesch, Matthias Heck, Kevin Baum, Markus Langer

专题命中 红队测试 :safety(abstract);分类 cs.CY

AI总结 本文从安全角度提出人工智能人类监督的威胁建模方法,系统分析其安全风险并提出缓解策略,以保障AI系统的监督过程安全可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 57%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11698 2026-07-14 cs.CR cs.AI 新提交 57%

Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

智能体攻击智能体:用于生产智能体红队测试的自动研究

Xutao Mao, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 研究生产型语言模型智能体的自动化红队测试,提出AHA可证伪发现循环,通过该循环构建漏洞概念图。在Claude Code和Codex上测试,发现跨模型和智能体的可重复使用漏洞核心,生成的VCG为安全团队提供可审计工件,提升测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏