Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
LLM智能体中针对提示注入的带外防御的自适应评估
机构 * LaunchSafe Research(LaunchSafe研究院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。
Comments 12 pages, 5 figures, 4 tables