Kill-Chain Canaries: Stage-Level Tracking of Prompt Injection Across Attack Surfaces and Model Safety Tiers
Kill-Chain Canaries: 阶段级跟踪跨攻击表面和模型安全层级的提示注入
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Chicago(芝加哥大学)
专题命中 越狱攻击 :safety(title,abstract);prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过跟踪加密令牌四个阶段,揭示提示注入是管道-架构问题,发现写节点位置是最高安全决策,所有防御因通道不匹配失效,且隐形白字体PDF负载可匹配或超越可见文本ASR。
Comments 10 pages, 8 figures. Benchmark code and run logs released