Defusing the Trigger: Tail-Risk-Informed Attention Rebalancing for LLM Backdoor Mitigation
解除触发器:通过尾风险内在几何平滑实现的插件式防御方法用于后门LLM
机构 * School of Cyber Science and Technology(网络安全科学与技术学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; University of Luxembourg(卢森堡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 本文提出TIGS方法,通过在推理时进行内容感知的尾风险筛查和内在几何平滑,有效抑制后门攻击,同时保持推理稳定性和语义一致性,适用于多种架构的LLM。