arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 10 篇

2604.11790 2026-05-12 cs.CR cs.AI 83%

ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection

ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架

Wei Zhao, Zhe Li, Peixin Zhang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI

AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25926 2026-05-12 cs.CR cs.LG 79%

Preventing Prompt Injection with Type-Directed Privilege Separation

通过类型引导的特权分离防止提示注入

Dennis Jacob, Emad Alghamdi, Zhanhao Hu, Basel Alomair, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。

Comments Revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21228 2026-05-12 cs.CR cs.AI 77%

CachePrune: Teaching LLMs What Not to Follow via KV-Cache Editing

CachePrune: 通过KV缓存编辑教LLMs不遵循指令

Rui Wang, Junda Wu, Yu Xia, Tong Yu, Ruiyi Zhang, Ryan Rossi, Subrata Mitra, Lina Yao, Julian McAuley

机构 * Adobe Research(Adobe研究院) University of California San Diego(加州大学圣地亚哥分校) University of New South Wales(新南威尔士大学)

专题命中 提示注入 :DPO(abstract,abstract_cn);prompt injection(abstract);分类 cs.AI

AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08326 2026-05-12 cs.LG cs.AI 73%

LLM Advertisement based on Neuron Auctions

基于神经拍卖的大型语言模型广告

Peiran Yun, Wenxin Xu, Jiayuan Liu, Yihang Zhang, Liang Zeng, Lingkai Kong, Tonghan Wang

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学)

专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。

Comments 17 pages, 9 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08257 2026-05-12 cs.CR cs.AI cs.LG 73%

Research on Security Enhancement Methods for Adversarial Robust Large Language Model Intelligent Agents for Medical Decision-Making Tasks

对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体

Saisai Hu

机构 * Pace University(帕克大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。

Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-05-12 cs.LG 70%

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 25 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02751 2026-05-12 cs.AI cs.CL 62%

Mitigating Misalignment Contagion by Steering with Implicit Traits

通过隐含特征引导缓解对齐传染

Maria Chang, Ronny Luss, Miao Liu, Keerthiram Murugesan, Karthikeyan Ramamurthy, Djallel Bouneffouf

机构 * IBM Research Yorktown Heights(IBM研究院Yorktown Heights)

专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多智能体交互中对齐传染问题,提出通过隐含特征引导技术维持模型初始亲社会行为,有效缓解因恶意引导导致的反社会倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI 57%

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16838 2026-05-12 cs.CR cs.AI cs.MA 57%

enclawed: A Configurable, Sector-Neutral Hardening Framework for Single-User AI Assistant Gateways

enclawed:一个可配置、无扇区偏见的单用户AI助手网关加固框架

Alfredo Metere

机构 * Metere Consulting, LLC(梅特尔咨询公司)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 enclawed为需要可验证的对等信任、默认拒绝外部连接、签名模块加载和可篡改审计追踪的部署提供加固框架,通过两种风味实现数据驱动的分类和高保证的对等认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08310 2026-05-12 cs.CR cs.AI 57%

WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation

WebTrap: 隐秘的中任务劫持攻击浏览器代理在导航过程中的行为

Zhichao Liu, Wenbo Pan, Haining Yu, Ge Gao, Tianqing Zhu, Xiaohua Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) City University of Hong Kong(香港城市大学) City University of Macau(澳门城市大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 WebTrap通过多步骤指令融合引导实现浏览器代理在导航任务中的隐秘劫持,提升攻击成功率同时保持系统可用性。

Comments 31 pages, 4 figures, 10 tables. Code: https://github.com/liuyaojialiuyaojia/WebTrap

详情

展开后加载摘要…

URL PDF HTML 收藏