When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift
当基准谎言:在真实分布偏移下评估恶意提示分类器
机构 * Zenity
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.LG
AI总结 研究通过LODO评估揭示了现有方法在真实分布偏移下的局限性,并展示了SAE特征在提升分类器解释性方面的潜力。
Comments v2: extended version of the AIWILD @ ICLR 2026 workshop paper; adds multi-model replication and additional analyses