arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 6 篇

2605.28999 2026-05-29 cs.CR cs.AI cs.CL cs.LG 82%

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

测量基于LLM的简历筛选中真实世界的提示注入攻击

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) Arizona State University(亚利桑那州立大学) hireEZ University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。

Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00991 2026-05-29 cs.AI cs.PL 70%

Tracking Capabilities for Safer Agents

更安全智能体的追踪能力

Martin Odersky, Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham

机构 * EPFL(苏黎世联邦理工学院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出通过Scala 3的捕获检查类型系统静态追踪能力,构建基于编程语言的智能体安全约束,防止信息泄露和恶意副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29737 2026-05-29 cs.CR cs.CL cs.SE 57%

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

最小提示扰动导致代码漏洞:编码大语言模型中的提示脆弱性和隐藏状态信号

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO, Le Foyer, Techno-Pôle 1, Sierre, Switzerland(瑞士苏黎世联邦理工学院(HES-SO)技术园区1号,西尔尔) Cyber-Defence Campus, armasuisse Science and Technology, Thun, Switzerland(瑞士图恩 Cyber-Defence 营地,armasuisse 科学与技术)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文通过token级突变实验,发现微小提示扰动(如单字符变化)即可使LLM生成代码从安全变为脆弱,并利用隐藏状态分析揭示输入处理漏洞比安全默认值漏洞更可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26506 2026-05-29 cs.CL cs.CR 57%

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

SafeReview: 防御基于LLM的评审系统免受对抗性隐藏提示攻击

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Backes, Yue Zhang, Linyi Yang

机构 * CISPA Westlake University(西交利物浦大学) Southern University of Science and Technology(南方科技大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 提出SafeReview,一种共进化对抗训练框架,通过联合训练生成器和防御者模型,增强基于LLM的同行评审系统对对抗性隐藏提示的鲁棒性。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29565 2026-05-29 cs.CV cs.RO 50%

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

从通用视觉到可靠的可通行性估计:适应视觉基础模型用于非结构化户外环境

Ji-Hoon Hwang, Jisung Bae, Dong-Wook Kim, Yeonkyu Lee, Seung-Woo Seo

专题命中 提示注入 :safety(abstract)

AI总结 提出ViTA框架,通过可学习提示、视角多样化训练和几何知识蒸馏,将视觉基础模型适应于非结构化户外环境的可靠可通行性估计,显著降低误报并提升跨域泛化。

Comments 8 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28017 2026-05-29 cs.CR cs.IR 50%

Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings

它能到达生成器吗?探究真实RAG设置中提示注入攻击的存活情况

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文在真实的三阶段RAG流水线(检索器→LLM重排序器→LLM生成器)中重新评估了七种生成式引擎优化(GEO)攻击,发现基于梯度和指令覆盖的攻击在到达生成器前大多失效,仅LLM驱动的提示注入保持端到端有效,且所有攻击易被轻量级防护检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏