arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 527 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 527 篇

2608.08027 2026-08-11 cs.CR cs.LG 新提交 79%

BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes

BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护

Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 79%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05715 2026-08-07 cs.RO cs.AI 新提交 79%

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究

S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04053 2026-08-06 cs.CR cs.AI 新提交 79%

AgentAntibody: An Adaptive Immune System for Defending LLM Agents against Prompt Injection

AgentAntibody:一种用于防御大语言模型(LLM)智能体提示注入的自适应免疫系统

Shihao Weng, Yang Feng, Xiaofei Xie, Jiongchi Yu

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 针对LLM智能体的提示注入威胁,受自适应免疫启发提出AgentAntibody,通过持久抗体库识别威胁并进化增强防御,实验显示其在防有害行为同时保留合法任务完成上优于现有防御。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 79%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19396 2026-08-04 cs.AI 版本更新 79%

CrackedPDFs: A Controlled Benchmark for Hidden Prompt Injection in PDFs

CrackedPDFs:用于PDF中隐藏提示注入的受控基准测试

Pukaphol Thienpreecha, Karthik Subramanian

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对PDF中隐藏提示注入问题,引入CrackedPDFs基准测试,评估多种检测方法,如PromptGuard、结构学习模型等,结果显示文档感知混合检测在受控配对评估下有效,但缺乏现实世界鲁棒性和跨家族泛化能力。

Comments Revised author metadata to include Karthik Subramanian; corrected paired-metric terminology; added code, dataset, reproduction, and archival information. Code: https://github.com/volkthienpreecha/crackedpdfs/releases/tag/v1.0.0-paper ; Dataset: https://huggingface.co/datasets/volkthienpreecha/crackedpdfs ; Archive: https://doi.org/10.5281/zenodo.21735803

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 79%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04425 2026-07-31 cs.CR cs.AI 版本更新 79%

What If Prompt Injection Never Left? Rethinking Agent Security through Cross-Session Stored Prompt Injection

如果提示注入从未消失?探索智能体系统中的跨会话存储提示注入

Yuanbo Xie, Wenlei Zhu, Tianyun Liu, Yingjie Zhang, Suchen Liu, Yulin Li, Liya Su, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AI Sec Lab, Beijing Chaitin Technology Co.,Ltd(北京柴坦科技有限公司AI安全实验室)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究引入跨会话存储提示注入,通过持久化状态使提示注入从单会话模型级威胁转变为长期系统级漏洞,并构建了分类法、基准测试和沙箱工具以评估风险。

Comments position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18248 2026-07-31 cs.CR cs.CL 版本更新 79%

Beyond Pattern Matching: Seven Cross-Domain Techniques for Prompt Injection Detection

超越模式匹配:七种跨领域技术用于提示注入检测

Thamilvendhan Munirathinam

机构 * Independent Researcher(独立研究者) prompt-shield project(prompt-shield项目)

专题命中 提示注入 :prompt injection(title);alignment(abstract);分类 cs.CL

AI总结 本文提出七种跨领域技术用于提示注入检测,通过引入来自不同领域的机制,如法医学语言学、材料科学疲劳分析、网络安全欺骗技术、生物信息学本地序列比对、经济学机制设计、流行病学谱信号分析和编译器理论中的污点跟踪,以改进现有的提示注入检测方法。

Comments v4 (31 pp, up from 27): adds Sec. 2.4 concurrent-work map (13 papers), Sec. 4.3 marked implemented (d034 ships in v0.7.3), Sec. 5.7 composed-stack adaptive-attack partial run, Sec. 5.8 50-doc held-out benchmark (d027 1.000->0.000 F1 in isolation, composed engine 0.815 F1), Sec. 7 architectural patterns. Repro tag: v0.7.3. Zenodo DOI 10.5281/zenodo.19644135

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14611 2026-07-17 cs.CR cs.AI cs.MA 新提交 79%

Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems

糟糕的记忆:评估智能体系统中内存引发的提示注入风险

Soham Gadgil, David Alexander, Sai Sunku, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究基于内存的智能体系统中提示注入攻击,利用沙盒合成工作区评估两个系统四个模型,发现虽难用外部内容重写内存文件,但已植入的有效载荷可攻击当前及未来会话,揭示持久内存改变威胁模型并推动相关防御研究。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08147 2026-07-10 cs.CR cs.AI 新提交 79%

Prismata: Confining Cross-Site Prompt Injection in Web Agents

Prismata:限制Web代理中的跨站提示注入

Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 79%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30783 2026-07-01 cs.CR cs.AI 新提交 79%

Security--Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense

安全--保真度权衡:提示注入防御的隐藏成本

Mitchell Hermon, Rahul Gupta, Weitong Ruan, Ekraam Sabir, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文发现防御间接提示注入会损害需要保留未信任文本的任务(如翻译),引入SecFid基准衡量保真度,揭示安全与保真度之间存在权衡,且无固定防御可同时最优。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 79%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27287 2026-06-26 cs.AI 新提交 79%

Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings

大型语言模型在自动化简历筛选中的提示注入:单注入与多注入设置

Preet Baxi, Jiannan Xu, Jane Yi Jiang, Stefanus Jasin

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究LLM在简历筛选中的提示注入攻击,发现当简历质量同质且注入者少时有效,但随注入者增多效果消失;质量异质时虽平均效果减弱,但偶尔让低质量候选人超越高质量,引发公平问题。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 79%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20717 2026-06-23 cs.CV cs.AI cs.CR 新提交 79%

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

机构 * SDU(山东大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19660 2026-06-19 cs.CR cs.CL 新提交 79%

A Layered Security Framework Against Prompt Injection in RAG-Based Chatbots

基于RAG的聊天机器人中针对提示注入的分层安全框架

Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan

机构 * ICCK Transactions on Information Security and Cryptography(信息安全与密码学国际会议交易)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 提出三层防御框架,通过输入过滤、上下文指令层级和输出审计,将提示注入攻击成功率从71.4%降至11.3%,误报率4.8%,延迟开销61.2毫秒。

Comments Submitted in ICCK Transactions on Information Security and Cryptography

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17986 2026-06-18 cs.CR cs.AI 版本更新 79%

LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection

LivePI:更真实的智能体对抗间接提示注入基准测试

Lei Zhao, Abhay Bhaskar, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09222 2026-06-16 cs.CR cs.AI 版本更新 79%

MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks

MUZZLE: 针对间接提示注入攻击的自适应智能体红队测试框架

Georgios Syros, Evan Rose, Brian Grinstead, Christoph Kerschbaumer, William Robertson, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学) Mozilla Corporation(Mozilla公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出MUZZLE框架,利用智能体轨迹自动识别高显著性注入面,自适应生成上下文相关的恶意指令,评估网络智能体对间接提示注入攻击的安全性,发现44种新攻击和跨应用攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12737 2026-06-12 cs.CR cs.AI 新提交 79%

PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections

PI-Hunter:用于暴露和定位提示注入的自动化红队测试

Pengfei He, Lesly Miculicich, Vishesh Sharma, Ash Fox, George Lee, Jiliang Tang, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Michigan State University(密歇根州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出PI-Hunter自动化审计框架,通过构建源感知测试用例并迭代演化,主动暴露LLM智能体中的潜在提示注入漏洞,显著提升漏洞暴露和攻击面覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 79%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09005 2026-06-09 cs.CR cs.CL 新提交 79%

Document-Authored Control-Signal Impersonation: A Low-Cost Indirect Prompt Attack on RAG Safety Boundaries

文档作者控制信号冒充:对RAG安全边界的低成本间接提示攻击

Jianguo Zhu

机构 * Chengdu University of Information Technology(成都信息工程大学)

专题命中 提示注入 :safety(title);prompt injection(abstract);分类 cs.CL

AI总结 研究检索增强生成系统中文档文本冒充控制信号的安全漏洞,提出非命令式间接注入攻击方法DACSI,并在多个模型上验证其有效性。

Comments Preprint. Independent-author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30677 2026-06-01 cs.CR cs.AI cs.SE 79%

Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents

针对软件逆向工程AI代理的提示注入攻击的检测与混淆研究

Brian Crawford, Patrick McClure

机构 * Dept. of Computer Science(计算机科学系) Naval Postgraduate School(海军学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本研究针对软件逆向工程AI代理面临的提示注入攻击,提出了检测反编译器输出中提示注入字符串的防御策略,并探索了攻击混淆及相应防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26999 2026-05-27 cs.CL cs.CR 79%

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

提示注入检测是依赖于场景的:一种基于可解释结构信号的部署感知评估

Akindoyin Akinrele, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本研究通过多模型、多场景的实验框架,评估了提示注入检测方法,发现检测性能高度依赖于部署场景和阈值选择,其中基于Transformer的模型表现最佳,结构信号在特定场景下提供适度但一致的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26159 2026-05-27 cs.NI cs.CR cs.LG 79%

Device Context Protocol: A Compact, Safety-First Architecture for LLM-Driven Control of Constrained Devices

设备上下文协议:一种紧凑、安全优先的架构,用于LLM驱动的受限设备控制

Dongxu Yang

机构 * DeepLethe

专题命中 提示注入 :safety(title,abstract);分类 cs.LG

AI总结 针对LLM控制受限设备的安全问题,提出设备上下文协议(DCP),通过极小的帧开销、协议层安全原语和主机端桥接,在保持低资源占用的同时有效防御幻觉和提示注入攻击。

Comments 15 pages, 5 figures. Reference implementation, Python package (pip install pydcp), and reproduction scripts at https://github.com/device-context-protocol/dcp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG 79%

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24421 2026-05-26 cs.CR cs.LG 79%

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

毒害瞭望塔:通过对抗性日志内容对LLM增强的安全运营进行提示注入攻击

Rohan Pandey, Archit Bhujang

机构 * DigitalOcean Arizona State University(亚利桑那州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 研究攻击者控制的日志字段如何向LLM注入指令(日志基底提示注入),提出四类攻击分类,并评估不同防御下的攻击成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22569 2026-05-20 cs.CR cs.AI 79%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25448 2026-05-20 cs.CR cs.CL 79%

Fingerprinting LLMs via Prompt Injection

通过提示注入指纹化LLM

Yuepeng Hu, Zhengyuan Jiang, Mengyuan Li, Osama Ahmed, Zhicong Huang, Cheng Hong, Neil Gong

机构 * Duke University(杜克大学) Ant Group(蚂蚁集团)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL

AI总结 本文提出LLMPrint框架,通过利用LLM对提示注入的固有脆弱性来构建指纹,以解决已发布模型的溯源问题,其核心方法是优化提示以获得唯一且抗后处理的指纹,实验显示其在高召回率下保持低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏