Query-Efficient Black-Box Red Teaming via Bayesian Optimization
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023 Long Paper - Main Conference
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023 Long Paper - Main Conference
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI;safety(comments)
Comments Accepted to The ART of Safety: Workshop on Adversarial testing and Red-Teaming for generative AI (IJCNLP-AACL 2023)
管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。
用于发现LLM安全中多样漏洞的质量-多样性进化
机构 * Rota Labs(Rota实验室)
专题命中 红队测试 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 提出基于质量-多样性进化框架(MAP-Elites)在语义层面生成可解释攻击策略,发现不同LLM的特定漏洞模式。
Comments 9 pages, 6 figures. Accepted at the ICLR 2026 Workshop on Agents in the Wild (AIWILD)
针对金融服务业LLM自动红队测试的风险调整危害评分
专题命中 红队测试 :red teaming(title);jailbreak(abstract);分类 cs.AI、cs.CY
AI总结 本文提出了一种针对金融服务业LLM安全风险的评估框架,通过风险敏感的RAHS度量标准,评估LLM在长期对抗压力下的安全性能。
机构 * Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) ; Meta ; Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.LG
机构 * Vijil / AI Risk and Vulnerability Alliance(Vijil / AI风险与漏洞联盟) ; AI Risk and Vulnerability Alliance(AI风险与漏洞联盟) ; Montreal AI Ethics Institute(蒙特利尔人工智能伦理研究所)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
Comments Conference on Applied Machine Learning for Information Security (CAMLIS) 2025
机构 * Oxford Internet Institute(牛津互联网研究所) ; University of Oxford(牛津大学) ; Amazon(亚马逊) ; Department of Computer Science(计算机科学系) ; University of Wisconsin - Eau Claire(威斯康星大学欧克莱尔分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.LG
机构 * University of Toronto(多伦多大学) ; Vector Institute for AI(人工智能向量研究所) ; Johns Hopkins Medical Institutions(约翰霍普金斯医学机构) ; University Health Network(医疗网络) ; Algoma University(阿尔戈马大学) ; University of Iowa Hospitals & Clinics(爱荷华大学医院与诊所) ; University of Edinburgh(爱丁堡大学)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI
机构 * Brown University(布朗大学) ; University of Cambridge(剑桥大学)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
Comments Forthcoming at the 2025 ACM Conference on Fairness, Accountability, and Transparency
专题命中 红队测试 :safety(title,abstract);分类 cs.AI、cs.LG
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI
Comments 20 pages, 5 figures, 11 tables. EMNLP2024 (main)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.AI
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.CY
Comments Updated with camera-ready version
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI、cs.LG
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CL、cs.CY
Comments arXiv admin note: substantial text overlap with arXiv:2312.05187
专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.CL、cs.LG
Comments Preprint. Accepted by TACL
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CY、cs.LG
通过提示级策略欺骗进行对齐审计压力测试
机构 * MATS ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Google Deepmind(谷歌DeepMind)
专题命中 红队测试 :alignment(title,abstract);分类 cs.LG;trustworthy(comments)
AI总结 本文提出自动红队流水线,通过生成针对白盒和黑盒审计方法的欺骗提示,揭示了当前对齐审计方法在面对强大非对齐模型时的脆弱性。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI
机构 * University College London(伦敦大学学院) ; Holistic AI(整体AI)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI
Comments Winner of the OpenAI GPT-OSS-20B Red Teaming Challenge (Kaggle, 2025)
为Gemini构建生产级探针
机构 * Google(谷歌)
专题命中 红队测试 :safety(abstract);red teaming(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出新的探针架构以应对长上下文分布变化,并通过实验验证其在网络安全领域的有效性,同时展示了自动化AI安全研究的初步成果。
Comments v4 (another minor acknowledgements fix)
REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量
专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.AI
AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规
Comments 6 figures, 4 tables. Supplementary material included
用于通过公开测试的代码的代码监控红队
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.AI
AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。
LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统
机构 * AIM Intelligence(AIM智能公司) ; KAERI(韩国原子能研究所)
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。
从战场到董事会:战略红队作为人工智能时代的知识治理工具
专题命中 红队测试 :red teaming(title,abstract);分类 cs.CY
AI总结 提出战略红队作为董事会层级的治理工具,通过六组件模型测试AI战略假设,将不确定性转化为可审查对象。
Comments 7 pages, technical report; arXiv edition of Apparens working paper
通过对抗性合成场景学习机器人安全策略
机构 * National Research Institute of Automation and Applied Mathematics(国家自动化与应用数学研究所)
专题命中 红队测试 :safety(title,abstract);分类 cs.AI
AI总结 提出一个基于对抗性游戏的框架,通过红蓝两队对抗生成危险场景并迭代优化安全策略,以高效发现高风险边缘案例。
FoeGlass: 简单的上下文学习足以对音频深度伪造检测器进行红队测试
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 红队测试 :red teaming(title,abstract);分类 cs.LG
AI总结 提出FoeGlass,一种基于大语言模型上下文学习的黑盒自动红队方法,通过生成音频样本发现深度伪造检测器的盲点,将假阴性率降低高达94%。
Comments Accepted at ICML 2026
对话式诈骗的剖析:基于主题的LLM多轮交互红队分析
机构 * Department of Computer Science, University of Iowa(爱荷华大学计算机科学系) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.CL
AI总结 通过LLM间模拟框架研究多轮社交工程对话中的对抗动态,分析攻击与防御策略,发现跨模型和跨语言的结果差异及策略转换的结构性变化。