Robustness via Referencing: Defending against Prompt Injection Attacks by Referencing the Executed Instruction
通过引用实现鲁棒性:通过引用已执行的指令来防御提示注入攻击
专题命中 指令微调 :large language model(abstract);language model(abstract)
AI总结 本文提出通过利用LLM的指令遵循能力来防御提示注入攻击,通过生成包含答案和对应指令引用的响应,有效过滤非原始指令关联的答案,实验表明其在降低攻击成功率方面优于现有方法。
Comments ACL 2026 Findings