Stop Testing Attacks, Start Diagnosing Defenses: The Four-Checkpoint Framework Reveals Where LLM Safety Breaks
停止测试攻击,开始诊断防御:四检查点框架揭示LLM安全为何破裂
机构 * Technische Universität Berlin(柏林技术大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出四检查点框架,通过输入输出阶段和检测级别两个维度分析LLM安全机制,揭示防御漏洞所在及原因,提出WASR指标评估安全性能。
Comments 17 pages, pre-print