arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-12 至 2026-08-12 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2608.10669 2026-08-12 cs.AI 新提交 79%

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量

Zixing Chen, Xingyuan Liu, Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.AI

AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规

Comments 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10171 2026-08-12 cs.AI cs.CR 新提交 57%

Generating Attacks for LLMs with GFlowNets

用GFlowNets为大语言模型生成攻击

Berkay Ozcam, Irem Onen, Mehmet Fatih Amasyali, Emin Islam Tatli

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本研究提出基于GFlowNets的自动化自适应红队评估方法,训练攻击者模型测试目标大语言模型,可生成更有效的英文攻击及土耳其语攻击输入,用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏