arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-20 至 2026-04-20 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2604.10577 2026-04-20 cs.CR cs.AI 85%

The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents

智能体安全的盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞

Xuwei Ding, Skylar Zhai, Linxin Song, Jiate Li, Taiwei Shi, Nicholas Meade, Siva Reddy, Jian Kang, Jieyu Zhao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Minnesota(明尼苏达大学) University of Southern California(南加州大学) McGill University(麦吉尔大学) Mila(Mila研究院) MBZUAI(MBZUAI研究院)

专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究揭示了良性用户指令下智能体安全漏洞,提出OS-BLIND基准测试,发现多数智能体在攻击条件下成功率高达90%以上,且在多智能体系统中风险加剧,现有安全措施效果有限。

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15368 2026-04-20 cs.CR 78%

LogJack: Indirect Prompt Injection Through Cloud Logs Against LLM Debugging Agents

LogJack:通过云日志间接提示注入攻击大语言模型调试代理

Harsh Shah

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究通过云日志内容对LLM调试代理进行间接提示注入攻击,提出LogJack基准测试集,并评估8个基础模型在不同提示条件下的表现,发现部分模型在主动条件下可执行命令,而防护措施大多失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15415 2026-04-20 cs.CR cs.AI 70%

HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents?

HarmfulSkillBench: 你的代理如何被有害技能所利用?

Yukun Jiang, Yage Zhang, Michael Backes, Xinyue Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文首次研究了代理生态系统中的有害技能,发现4.93%的技能具有潜在危害,并构建了HarmfulSkillBench基准,评估六个LLM在有害技能下的表现,发现预装技能显著降低拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏