arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-04 至 2026-06-04 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2606.05101 2026-06-04 cs.SD cs.LG 79%

FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors

FoeGlass: 简单的上下文学习足以对音频深度伪造检测器进行红队测试

Sepehr Dehdashtian, Jacob H Seidman, Vishnu N Boddeti, Gaurav Bharaj

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 红队测试 :red teaming(title,abstract);分类 cs.LG

AI总结 提出FoeGlass,一种基于大语言模型上下文学习的黑盒自动红队方法,通过生成音频样本发现深度伪造检测器的盲点,将假阴性率降低高达94%。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 73%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 红队测试 :safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏