arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 4 篇

2605.17075 2026-05-19 cs.CR 78%

A Red Teaming Framework for Evaluating Robustness of AI-enabled Security Orchestration, Automation, and Response Systems

一种用于评估AI增强的安全编排、自动化和响应系统鲁棒性的红队框架

Ayan Javeed Shaikh, Nathaniel D. Bastian, Ankit Shah

专题命中 红队测试 :red teaming(title,abstract)

AI总结 本文提出了一种结合大语言模型和强化学习的自主红队框架,用于评估企业网络中自主防御系统的鲁棒性,展示了单一LLM代理在多阶段攻击中的不足以及领域特定安全模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17380 2026-05-19 cs.AI cs.CR cs.LG 73%

ADR: An Agentic Detection System for Enterprise Agentic AI Security

ADR:一种用于企业代理AI安全的代理检测系统

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang

机构 * Uber

专题命中 红队测试 :red teaming(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADR系统,一种大规模、经过生产验证的企业框架,用于安全地管理通过模型上下文协议(MCP)运行的AI代理。该系统解决了三个关键问题:观测有限、鲁棒性不足和检测成本高,并通过三个组件实现了这些目标:ADR传感器、ADR探索器和ADR检测器。

Comments Accepted at MLSys 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07239 2026-05-19 cs.CL 57%

Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts

Red-Bandit:通过带引导的LoRA专家实现LLM红队测试的测试时适应

Christos Ziakas, Nicholas Loo, Nishita Jain, Alessandra Russo

机构 * Imperial College London(伦敦帝国学院)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 本文提出Red-Bandit框架,通过带引导的LoRA专家在不同攻击风格下实现LLM的测试时适应,通过强化学习生成不安全提示,并利用多臂老虎机策略动态选择攻击风格专家,从而在AdvBench上取得最佳结果,同时生成更易读的提示。

Comments Accepted to the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17163 2026-05-19 cs.CR cs.AI 57%

STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment

STRIDE-AI: 一种用于生成式AI安全评估的威胁建模框架

Tsafac Nkombong Regine Cyrille, Franziska Schwarz

机构 * SRH University of Applied Sciences Heidelberg School of Technology(海德堡应用科学大学技术与建筑学院)

专题命中 红队测试 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出STRIDE-AI框架,旨在填补高层风险标准与技术漏洞分类之间的差距,通过六个阶段的评估生命周期和针对AI系统的威胁建模适应,降低AI系统面临攻击的成功率。

Comments 4 pages, 5 figures , 2 tables, CIIT 2026 23rd International Conference on Informatics and Information Technologies (CIIT)

详情

展开后加载摘要…

URL PDF HTML 收藏