When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers
当解释背叛后门:语言模型分类器的黑盒审计
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 其他LLM :language model(title,abstract);分类 cs.CL
AI总结 本文针对仅拥有干净校准数据的黑盒场景,提出接地漂移方法,在5%干净FPR预算下,于7B主干等实验中实现了比现有检测器更优的后门检测性能。
Comments 16 pages, 1 figure