arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-26 至 2026-03-26 共收录 1 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 1 篇

2602.24055 2026-03-26 cs.AI cs.SE 57%

CIRCLE: A Framework for Evaluating AI from a Real-World Lens

CIRCLE:从现实视角评估AI的框架

Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters, Rumman Chowdhury, Thiago Lacerda

机构 * Civitaas Insights Bournemouth University(伯恩茅斯大学) Independent Researcher(独立研究者) Cohere Labs(Cohere实验室) National Research Council Canada(加拿大国家研究理事会) Intellect Frontier University of Sydney(悉尼大学) National Physical Laboratory, UK(英国国家物理实验室) Université de Sherbrooke(谢布罗克大学) University of Washington(华盛顿大学) Principled AI Humane Intelligence Non-profit(人智非营利组织) Virginia State University(弗吉尼亚州立大学) Humane Intelligence Public Benefit Corporation(人智公共利益公司)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出CIRCLE框架,通过六个阶段生命周期方法,弥合模型性能指标与部署中AI实际结果之间的现实差距,提供系统性的实证证据。

Comments Accepted at Intelligent Systems Conference (IntelliSys) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏