SAGE-RT: Synthetic Alignment data Generation for Safety Evaluation and Red Teaming
专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
机构 * Independent Researcher(独立研究者)
专题命中 红队测试 :jailbreak(title,abstract);prompt injection(title,abstract);red teaming(title);alignment(abstract)
Comments 7 Pages, 6 Figures
做自己的红队:通过自play和反思经验回放实现安全对齐
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);red teaming(abstract)
AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。
专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);alignment(abstract);分类 cs.CL、cs.CY、cs.LG
Comments 17 pages, preprint
专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Findings of the 2023 Conference on Empirical Methods in Natural Language Processing
Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。
Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025
立场:防止人工智能生成的儿童性虐待材料需要新的人工智能安全方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Thorn
专题命中 红队测试 :safety(title,abstract);AI safety(title,abstract);red teaming(abstract);分类 cs.AI、cs.CY
AI总结 研究人工智能给儿童安全带来的新风险,指出保护儿童免受其助长的性虐待需新安全方法。探讨现有技术与相关约束的不兼容及带来的挑战,概述15个开放性问题并给出针对性建议,推动将负责任AI原则转化为儿童保护措施。
Comments Accepted (spotlight) in ICML 2026, Position Paper Track. The first two authors contributed equally and may list their names interchangeably
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);safety(abstract);分类 cs.AI、cs.LG
Comments To be published in ACM MM 2024
专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);AI safety(abstract);分类 cs.AI
专题命中 红队测试 :alignment(title,abstract);safety(title,abstract);red teaming(abstract);分类 cs.AI
Comments 23 pages, 15 figures
机构 * University of Kent(肯特大学)
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);prompt injection(abstract)
医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
机构 * John Snow Labs Inc.(约翰·索克斯实验室公司)
专题命中 红队测试 :safety(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
AI总结 提出一个多领域红队框架,通过690个临床场景评估11个当代大语言模型,发现平均准确率掩盖了临床意义上的风险,性能方差和最坏情况失败比平均准确率更能反映可靠性,混合评估方法对可信安全评估至关重要。
Comments 10 pages, 4 figures. To be presented at the Text2Story 2026 Workshop (Delft, The Netherlands, 29 March 2026); CEUR Workshop Proceedings (forthcoming). Affiliation: John Snow Labs Inc
机构 * East China Normal University(东华大学) ; Xi’an Jiaotong University(西安交通大学) ; Meituan(美团) ; Zhejiang University(浙江大学)
专题命中 红队测试 :safety(title,abstract);red teaming(title);alignment(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2025 main conference
机构 * AIM Intelligence(AIM智能研究所) ; University of Seoul(首尔大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Seoul National University(首尔国立大学) ; Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院) ; Kyung Hee University(庆熙大学)
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to ACL 2025 (Main Track). Camera-ready version
Journal ref Proc. ACL 2025 (Vol. 1: Long Papers), pp. 16489-16507, Vienna, Austria, 2025
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title);safety(abstract);分类 cs.CL、cs.LG
Comments technical report; update code repo link
学习攻击与防御:通过GRPO对语言模型进行自适应红队测试
机构 * Microsoft AI Red Team(微软AI红队) ; Microsoft Azure(微软Azure)
专题命中 红队测试 :red teaming(title,abstract);DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。
专题命中 红队测试 :safety(title,abstract);alignment(abstract);jailbreak(abstract);red teaming(abstract)
机构 * Pengfei Du(独立研究者)
专题命中 红队测试 :alignment(title,abstract);red teaming(title,abstract);分类 cs.AI
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title);safety(abstract);分类 cs.AI
RedTopic:迈向大语言模型的课题多样化红队测试
机构 * Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学) ; Deakin University(德克萨斯大学) ; Hon Hai Research Institute(鸿海研究室) ; Hong Kong University of Science and Technology(香港理工大学)
专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);trustworthy(abstract)
LLMs的在线安全监控
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。
Comments ICML 2026 Hypothesis Testing Workshop
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 11 figures
机构红队测试:部署规则而非模型,因果性地塑造多智能体人工智能安全
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 红队测试 :safety(title,abstract);AI safety(title);分类 cs.AI
AI总结 研究多智能体人工智能安全中部署规则的影响,提出机构红队测试方法,通过IABench-CA实例化,发现规则改变集体安全、无安全默认规则、身份显著性是机制,还打包成安全案例工作流程认证规则区域并明确风险义务。
机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) ; Sursen Corp.(苏尔森公司) ; China Academy of Electronics and Information Technology(中国电子信息技术研究院)
专题命中 红队测试 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY
机构 * University of Virginia(弗吉尼亚大学) ; University of Georgia(佐治亚大学)
专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.LG
Comments 26 pages, 13 figures
机构 * Bloomberg AI(布莱尔人工智能) ; University of Maryland(马里兰大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 红队测试 :safety(title,abstract);red teaming(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments NAACL 2025
专题命中 红队测试 :red teaming(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments Working in progress
智能体对抗智能体:一种用于自动提示注入红队测试的智能体系统
专题命中 红队测试 :prompt injection(title,abstract);red teaming(title)
AI总结 本研究提出PIMiner智能体系统,用于自动提示注入红队测试,该系统构建可迁移策略库,仅需少量查询即可在IPIArena、AgentDojo基准上对多款LLM实现高攻击成功率,解决现有方法泛化性差的问题。
Comments Our code is available at https://github.com/wang-yanting/PIMiner