arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-01 至 2026-07-01 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 3 篇

2606.30783 2026-07-01 cs.CR cs.AI 新提交 79%

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

安全--保真度权衡:提示注入防御的隐藏成本

Mitchell Hermon, Rahul Gupta, Weitong Ruan, Ekraam Sabir, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文发现防御间接提示注入会损害需要保留未信任文本的任务(如翻译),引入SecFid基准衡量保真度,揭示安全与保真度之间存在权衡,且无固定防御可同时最优。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 57%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 50%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 提示注入 :prompt injection(abstract)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏