arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-03 至 2026-07-03 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 3 篇

2607.02510 2026-07-03 cs.AI cs.CL cs.LG stat.AP stat.ML 新提交 87%

Online Safety Monitoring for LLMs

LLMs的在线安全监控

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01913 2026-07-03 cs.CY 新提交 79%

From Battlefield to Boardroom: Strategic Red Teaming as an Epistemic Governance Instrument in the Age of AI

从战场到董事会:战略红队作为人工智能时代的知识治理工具

Jeroen Janssen

专题命中 红队测试 :red teaming(title,abstract);分类 cs.CY

AI总结 提出战略红队作为董事会层级的治理工具,通过六组件模型测试AI战略假设,将不确定性转化为可审查对象。

Comments 7 pages, technical report; arXiv edition of Apparens working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22063 2026-07-03 cs.SE cs.AI 版本更新 74%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 红队测试 :red teaming(title);分类 cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏