arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 250 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 250 篇

2605.00553 2026-07-01 cs.LG 版本更新 57%

Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance

Stable-GFlowNet: 通过对比轨迹平衡实现多样且鲁棒的LLM红队测试

Minchan Kwon, Sunghyun Baek, Minseo Kim, Jaemyung Yu, Dongyoon Han, Junmo Kim

机构 * Naver AI Lab(Naver AI实验室)

专题命中 红队测试 :safety(abstract);分类 cs.LG

AI总结 针对大语言模型红队测试中有效性与多样性难以兼顾的问题,提出Stable-GFlowNet方法,通过消除配分函数估计和对比轨迹平衡实现稳定训练,在保持最优策略的同时提升攻击性能与多样性。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28425 2026-06-30 cs.CR cs.AI 57%

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

工具使用使多智能体LLM系统中的隐写术无法检测

Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa, Christian Schroeder de Witt

机构 * Oxford University(牛津大学) Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19864 2026-06-19 cs.CL 新提交 57%

The Almost Intelligent Revolution: Options for Scaling Up Deliberation and Empowering People with AI

近乎智能的革命:扩大审议规模并利用AI赋能人类的选项

Serge Sharoff

机构 * Centre on Participatory and Deliberative Democracy(参与性和协商性民主研究中心)

专题命中 红队测试 :red teaming(abstract);分类 cs.CL

AI总结 探讨大型语言模型如何通过系统功能语言学视角扩大民主审议规模,增强包容性并赋权边缘群体,同时警惕过度承诺与低估风险。

Comments Published in /Handbook of Democracy in the Era of Artificial Intelligence/ edited by Evangelos Pournaras, Srijoni Majumdar, Carina Ines Hausladen, and Dirk Helbing. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18532 2026-06-18 cs.CR cs.AI cs.RO cs.SE 新提交 57%

AI Sandboxes: A Threat Model, Taxonomy, and Measurement Framework

AI沙箱:威胁模型、分类法与测量框架

Inderjeet Singh, Haitham Mahmoud, Andrés Murillo

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 提出AI沙箱的威胁模型、分类法和测量框架,形式化沙箱边界与最弱链规则,定义网络物理威胁模型,并通过三个案例验证。

Comments 50 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12918 2026-06-15 cs.CR cs.AI 新提交 57%

MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems

MAStrike: 基于Shapley值的多智能体系统合谋红队测试

Chejian Xu, Zhaorun Chen, Jingyang Zhang, Freddy Lecue, Avni Kothari, Sarah Tan, Wenbo Guo, Bo Li

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virtue AI University of Chicago(芝加哥大学) Wells Fargo(摩根大通) Salesforce University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 提出MAStrike框架,通过Shapley值分析识别多智能体系统中脆弱智能体联盟,生成角色感知的对抗攻击,并迭代优化以绕过防御,显著优于启发式基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10807 2026-06-05 cs.CR cs.AR cs.LG 57%

LLMs for Secure Hardware Design and Related Problems: Opportunities and Challenges

利用大语言模型进行安全硬件设计及相关问题:机遇与挑战

Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) NYU Tandon School of Engineering(纽约大学塔能工程学院)

专题命中 红队测试 :trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型在电子设计自动化和硬件安全领域的应用,分析了其在生成RTL代码、自动生成测试平台以及弥合高层次规格与硅芯片之间语义差距方面的潜力,同时指出了其引入的严重安全漏洞,并总结了当前研究的最新进展和未来研究方向。

Comments Accepted for 2026 IEEE Computer Society Annual Symposium on VLSI (ISVLSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25066 2026-05-26 quant-ph cs.CR cs.LG 57%

QML-PipeGuard: Drift-Aware Behavioral Fingerprinting for Quantum Machine Learning Pipeline Integrity

QML-PipeGuard:面向量子机器学习管道完整性的漂移感知行为指纹识别

Esra Yeniaras

机构 * Quantum Security and Post-Quantum Cryptography Researcher(量子安全与后量子密码学研究员)

专题命中 红队测试 :safety(abstract);分类 cs.LG

AI总结 提出QML-PipeGuard框架,通过行为指纹和基于合约的监测机制,同时应对量子机器学习管道中的硬件漂移和恶意信道替换威胁。

Comments 54 pages, 12 Tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07239 2026-05-19 cs.CL 57%

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit:通过带引导的LoRA专家实现LLM红队测试的测试时适应

Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 本文提出Red-Bandit框架,通过带引导的LoRA专家在不同攻击风格下实现LLM的测试时适应,通过强化学习生成不安全提示,并利用多臂老虎机策略动态选择攻击风格专家,从而在AdvBench上取得最佳结果,同时生成更易读的提示。

Comments Accepted to the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17163 2026-05-19 cs.CR cs.AI 57%

STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment

STRIDE-AI: 一种用于生成式AI安全评估的威胁建模框架

Tsafac Nkombong Regine Cyrille, Franziska Schwarz

机构 * SRH University of Applied Sciences Heidelberg School of Technology(海德堡应用科学大学技术与建筑学院)

专题命中 红队测试 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出STRIDE-AI框架,旨在填补高层风险标准与技术漏洞分类之间的差距,通过六个阶段的评估生命周期和针对AI系统的威胁建模适应,降低AI系统面临攻击的成功率。

Comments 4 pages, 5 figures , 2 tables, CIIT 2026 23rd International Conference on Informatics and Information Technologies (CIIT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09689 2026-04-20 cs.CR cs.AI 57%

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

当搜索出错时:针对具有网络搜索功能的大型语言模型的红队测试

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University of Aeronautics(南京航空航天大学) Tsinghua University, China(清华大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文提出CREST-Search框架,针对具有网络搜索功能的LLM的安全性问题,通过三种新型攻击策略和迭代上下文优化机制,揭示网络搜索带来的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24055 2026-03-26 cs.AI cs.SE 57%

CIRCLE: A Framework for Evaluating AI from a Real-World Lens

CIRCLE:从现实视角评估AI的框架

Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters, Rumman Chowdhury, Thiago Lacerda

机构 * Civitaas Insights Bournemouth University(伯恩茅斯大学) Independent Researcher(独立研究者) Cohere Labs(Cohere实验室) National Research Council Canada(加拿大国家研究理事会) Intellect Frontier University of Sydney(悉尼大学) National Physical Laboratory, UK(英国国家物理实验室) Université de Sherbrooke(谢布罗克大学) University of Washington(华盛顿大学) Principled AI Humane Intelligence Non-profit(人智非营利组织) Virginia State University(弗吉尼亚州立大学) Humane Intelligence Public Benefit Corporation(人智公共利益公司)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出CIRCLE框架,通过六个阶段生命周期方法,弥合模型性能指标与部署中AI实际结果之间的现实差距,提供系统性的实证证据。

Comments Accepted at Intelligent Systems Conference (IntelliSys) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20925 2026-03-24 cs.AI 57%

Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions

利润是红队:在战略经济互动中压力测试代理

Shouqiao Wang, Marcello Politi, Samuele Marro, Davide Crapis

机构 * Columbia University(哥伦比亚大学) dAI Team, Ethereum Foundation(dAI团队,以太坊基金会) University of Oxford(牛津大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出基于利润的红队测试方法,通过学习对手最大化利润来压力测试代理,发现传统静态基线在利润优化压力下易受攻击,且学习对手能自主发现 probing、anchoring 和 deceptive commitments 策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13042 2026-02-16 cs.LG 57%

GPTZero: Robust Detection of LLM-Generated Texts

GPTZero:鲁棒的LLM生成文本检测

George Alexandru Adam, Alexander Cui, Edwin Thomas, Emily Napier, Nazar Shmatko, Jacob Schnell, Jacob Junqi Tian, Alekhya Dronavalli, Edward Tian, Dongwon Lee

专题命中 红队测试 :red teaming(abstract);分类 cs.LG

AI总结 GPTZero通过分层多任务架构实现鲁棒的LLM生成文本检测,提供准确可解释的检测方法和负责任的使用教育。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10004 2026-01-16 cs.CR cs.LG 57%

SoK: Privacy-aware LLM in Healthcare: Threat Model, Privacy Techniques, Challenges and Recommendations

SoK:面向医疗的隐私保护大语言模型:威胁模型、隐私技术、挑战与建议

Mohoshin Ara Tahera, Karamveer Singh Sidhu, Shuvalaxmi Dass, Sajal Saha

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Northern British Columbia, Canada(北部BC大学)

专题命中 红队测试 :trustworthy(abstract);分类 cs.LG

AI总结 本文系统分析了医疗领域大语言模型的隐私保护问题,探讨了威胁模型、隐私技术及挑战,并提出针对不同阶段的防护建议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05293 2026-01-12 cs.CR cs.AI 57%

A Survey of Agentic AI and Cybersecurity: Challenges, Opportunities and Use-case Prototypes

代理AI与网络安全的综述:挑战、机遇与用例原型

Sahaya Jestus Lazer, Kshitiz Aryal, Maanak Gupta, Elisa Bertino

机构 * Tennessee Tech University(田纳西科技大学) University of Nebraska Omaha(内布拉斯加大学奥马哈分校) Purdue University(普渡大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文综述了代理AI在网络安全中的应用,探讨了其在防御和攻击方面的双重用途,分析了系统性风险,并展示了三个实际用例以说明其在网络安全中的行为和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21176 2025-12-23 cs.AI 57%

Toward Revealing Nuanced Biases in Medical LLMs

向揭示医疗大语言模型中的细微偏见迈进

Farzana Islam Adiba, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14745 2025-12-18 cs.CR cs.AI 57%

Factor(U,T): Controlling Untrusted AI by Monitoring their Plans

Factor(U,T): 通过监控其计划来控制不可信的AI

Edward Lue Chee Lip, Anthony Channg, Diana Kim, Aaron Sandoval, Kevin Zhu

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 Factor(U,T)通过监控AI分解计划来控制不可信AI,实验表明在仅观察自然语言指令时,监控恶意活动效果有限,而结合子任务监控则能实现高区分度和安全性。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 6 pages body, 8 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07810 2025-12-09 cs.AI 57%

Auditing Games for Sandbagging

对沙袋行为进行审计游戏

Jordan Taylor, Sid Black, Dillon Bowen, Thomas Read, Satvik Golechha, Alex Zelenka-Martin, Oliver Makins, Connor Kissane, Kola Ayonrinde, Jacob Merizian, Samuel Marks, Chris Cundy, Joseph Bloom

机构 * UK AI Security Institute(英国人工智能安全研究所) Anthropic

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文通过审计游戏测试了沙袋行为检测方法,发现黑盒方法易受模仿影响,基于训练的引导能有效提取性能,但需进一步研究以提高检测鲁棒性。

Comments 77 pages (28 non-appendix pages), 38 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02157 2025-12-03 cs.CR cs.CL 57%

Factor(T,U): Factored Cognition Strengthens Monitoring of Untrusted AI

因子(T,U):因子认知强化对不可信AI的监控

Aaron Sandoval, Cody Rushing

机构 * Independent(独立研究者)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 本文提出基于因子认知的AI控制协议,通过分解任务和独立解决子任务来提高安全性,实验显示其在提升监控性能和降低后门风险方面具有显著效果。

Comments 7 pages body; 19 pages total; 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00203 2025-11-04 cs.LG stat.ML 57%

Diffusion LLMs are Natural Adversaries for any LLM

David Lüdke, Tom Wollschläger, Paul Ungermann, Stephan Günnemann, Leo Schwinn

机构 * Department of Computer Science \& Munich Data Science Institute Technical University of Munich, Germany

专题命中 红队测试 :red teaming(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23006 2025-09-30 cs.AI 57%

Creative Adversarial Testing (CAT): A Novel Framework for Evaluating Goal-Oriented Agentic AI Systems

Hassen Dhrif

机构 * Amazon(亚马逊)

专题命中 红队测试 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13597 2025-09-18 cs.CR cs.AI 57%

Agentic JWT: A Secure Delegation Protocol for Autonomous AI Agents

Abhishek Goswami

专题命中 红队测试 :prompt injection(abstract);分类 cs.AI

Comments 17 pages, 6 figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06380 2025-05-13 cs.CR cs.AI 57%

Offensive Security for AI Systems: Concepts, Practices, and Applications

Josh Harguess, Chris M. Ward

机构 * Fire Mountain Labs(Fire Mountain实验室)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11917 2025-04-23 cs.CR cs.AI 57%

A Framework for Evaluating Emerging Cyberattack Capabilities of AI

Mikel Rodriguez, Raluca Ada Popa, Four Flynn, Lihao Liang, Allan Dafoe, Anna Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00895 2024-08-05 cs.LG quant-ph 57%

Discrete Randomized Smoothing Meets Quantum Computing

Tom Wollschläger, Aman Saxena, Nicola Franco, Jeanette Miriam Lorenz, Stephan Günnemann

专题命中 红队测试 :safety(abstract);分类 cs.LG

Journal ref International Conference on Quantum Computing and Engineering, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00862 2023-08-07 cs.CY 57%

Confidence-Building Measures for Artificial Intelligence: Workshop Proceedings

Sarah Shoker, Andrew Reddie, Sarah Barrington, Ruby Booth, Miles Brundage, Husanjot Chahal, Michael Depp, Bill Drexel, Ritwik Gupta, Marina Favaro, Jake Hecla, Alan Hickey, Margarita Konaev, Kirthi Kumar, Nathan Lambert, Andrew Lohn, Cullen O'Keefe, Nazneen Rajani, Michael Sellitto, Robert Trager, Leah Walker, Alexa Wehsener, Jessica Young

专题命中 红队测试 :red teaming(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03097 2023-06-07 cs.HC cs.AI 57%

Seeing Seeds Beyond Weeds: Green Teaming Generative AI for Beneficial Uses

Logan Stapleton, Jordan Taylor, Sarah Fox, Tongshuang Wu, Haiyi Zhu

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.01362 2021-10-05 cs.CR cs.LG 57%

Automating Privilege Escalation with Deep Reinforcement Learning

Kalle Kujanpää, Willie Victor, Alexander Ilin

专题命中 红队测试 :red teaming(abstract);分类 cs.LG

Comments To appear at AISec'21 (aisec.cc)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.11958 2019-01-01 cs.LG stat.ML 57%

Gray-box Adversarial Testing for Control Systems with Machine Learning Component

Shakiba Yaghoubi, Georgios Fainekos

专题命中 红队测试 :safety(abstract);分类 cs.LG

Comments 11 pages, 5 figures, 1 table, International Conference on Hybrid Systems: Computation and Control (HSSC) 2019, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07321 2023-05-09 cs.CL cs.CR cs.CY cs.LG 56%

Machine Generated Text: A Comprehensive Survey of Threat Models and Detection Methods

Evan Crothers, Nathalie Japkowicz, Herna Viktor

专题命中 红队测试 :分类 cs.CL、cs.CY、cs.LG;trustworthy(comments)

Comments Manuscript submitted to ACM Special Session on Trustworthy AI. 2022/11/19 - Updated references

详情

展开后加载摘要…

URL PDF HTML 收藏