arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2604.12232 2026-04-15 cs.CR cs.AI cs.SE 85%

TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs

TEMPLATEFUZZ:细粒度聊天模板模糊测试用于突破和红队测试大语言模型

Qingchao Shen, Zibo Xiao, Lili Huang, Enwei Hu, Yongqiang Tian, Junjie Chen

机构 * School of Computer Software(计算机软件学院) Tianjin University(天津大学) Monash University(墨尔本大学)

专题命中 红队测试 :red teaming(title);safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文提出TEMPLATEFUZZ框架,通过细粒度模糊测试揭示大语言模型聊天模板的漏洞,实现高攻击成功率的同时保持模型准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00412 2026-04-15 cs.CR cs.AI 79%

Red Teaming Large Reasoning Models

对大型推理模型进行红队测试

Jiawei Chen, Yang Yang, Chao Yu, Yu Tian, Zhi Cao, Xue Yang, Linghao Li, Hang Su, Zhaoxia Yin

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University(上海多维信息处理关键实验室,东华大学) Zhongguancun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Dept. of Comp. Sci. and Tech., THBI Lab, Tsinghua University(计算机科学与技术系,清华THBI实验室) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.AI

AI总结 本文提出RT-LRM基准,评估大型推理模型的可信度,揭示其在面对推理风险时的脆弱性,并发布工具箱支持未来研究。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏