arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY 87%

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22489 2026-03-25 cs.CR cs.SE 71%

Model Context Protocol Threat Modeling and Analyzing Vulnerabilities to Prompt Injection with Tool Poisoning

模型上下文协议威胁建模及针对提示注入的漏洞分析

Charoes Huang, Xin Huang, Ngoc Phu Tran, Amin Milani Fard

专题命中 红队测试 :prompt injection(title)

AI总结 本文基于STRIDE和DREAD框架对MCP五个关键组件进行威胁建模,发现工具污染是主要客户端漏洞,提出多层防御策略以提升AI代理生态的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏