arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-01 至 2026-04-01 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 2 篇

2603.30016 2026-04-01 cs.CR cs.AI 79%

Architecting Secure AI Agents: Perspectives on System-Level Defenses Against Indirect Prompt Injection Attacks

构建安全的AI代理:系统级防御间接提示注入攻击的视角

Chong Xiang, Drew Zagieboylo, Shaona Ghosh, Sanjay Kariyappa, Kai Greshake, Hanshen Xiao, Chaowei Xiao, G. Edward Suh

机构 * NVIDIA(英伟达) Independent Researcher(独立研究员) Johns Hopkins University(约翰霍普金斯大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文探讨了针对间接提示注入攻击的系统级防御策略,提出动态重计划、安全策略更新及人类交互在代理设计中的重要性,同时指出现有基准的局限性及系统级防御的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22519 2026-04-01 cs.SE cs.AI cs.PL 70%

LLMON: An LLM-native Markup Language to Leverage Structure and Semantics at the LLM Interface

LLMON:一种面向大语言模型的标记语言,用于在大语言模型接口中利用结构和语义

Michael Hind, Basel Shbita, Bo Wu, Farhan Ahmed, Chad DeLuca, Nathan Fulton, David Cox, Dan Gutfreund

机构 * IBM Research(IBM研究院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 LLMON通过引入一种面向大语言模型的标记语言,使文本的结构和语义元数据能自然地传递给大语言模型,从而提升模型的准确性、安全性和稳定性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏