arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-05 至 2026-06-05 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2606.05566 2026-06-05 cs.AI cs.CR 88%

GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection

GuardNet: 用于鲁棒提示注入和越狱检测的浅层神经网络集成策略

Paulo Ricardo Ferreira Neves, Edson Rodrigues da Cruz Filho, Paulo Henrique Eleuterio Falsetti, João Vitor Pavan, Ian Degaspari, Henrique Vieira Laturrague, Patrick Vieira Laturrague, Guilherme Nielsen Dias, Marccello Wilson Perez Berto, Gustavo Voltani Von Atzingen

机构 * Quickium Technology Ltd.(Quickium技术有限公司) Federal University of São Carlos (UFSCar)(萨尔瓦多·卡罗斯联邦大学) Federal Institute of Education, Science and Technology of São Paulo (IFSP)(圣保罗教育、科学和技术联邦研究所)

专题命中 提示注入 :jailbreak(title,abstract);prompt injection(title,abstract);分类 cs.AI

AI总结 提出GuardNet,一种基于浅层神经网络(BiLSTM)集成的护栏系统,通过多样性示例覆盖和阈值校准实现对抗鲁棒性,在低延迟下达到与轻量检测器竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09923 2026-06-05 cs.AI 57%

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents

Hanna Foerster, Tom Blanchard, Kristina Nikolić, Ilia Shumailov, Cheng Zhang, Robert Mullins, Nicolas Papernot, Florian Tramèr, Yiren Zhao

机构 * University of Cambridge(剑桥大学) University of Toronto & Vector Institute(多伦多大学及向量研究所) ETH Zurich(苏黎世联邦理工学院) AI Security Company(人工智能安全公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全方法,用于计算机使用代理(CUAs),通过单次规划和NOVA框架在动态UI状态下提供控制流完整性保障,同时在保持性能的同时提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏