arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2601.03699 2026-04-20 cs.CL 83%

RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models

RedBench:用于大型语言模型全面红队测试的通用数据集

Quy-Anh Dang, Chris Ngo, Truong-Son Hy

机构 * Knovel Engineering Lab(Knovel工程实验室) Knovel Engineering Singapore(Knovel工程新加坡) VNU University of Science(越南科学技术大学)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL

AI总结 RedBench通过整合37个基准数据集,提供标准化的风险分类和领域框架,用于系统评估大型语言模型的安全性,促进鲁棒性比较和未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09689 2026-04-20 cs.CR cs.AI 57%

When Search Goes Wrong: Red-Teaming Web-Augmented Large Language Models

当搜索出错时:针对具有网络搜索功能的大型语言模型的红队测试

Haoran Ou, Kangjie Chen, Xingshuo Han, Gelei Deng, Jie Zhang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Nanjing University of Aeronautics(南京航空航天大学) Tsinghua University, China(清华大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI

AI总结 本文提出CREST-Search框架,针对具有网络搜索功能的LLM的安全性问题,通过三种新型攻击策略和迭代上下文优化机制,揭示网络搜索带来的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏