Purifying Generative LLMs from Backdoors without Prior Knowledge or Clean Reference
从后门中净化生成式大语言模型而不依赖先验知识或干净参考
机构 * Department of Computer Science(计算机科学系)
AI总结 本文提出一种无需先验知识或干净参考的生成式大语言模型净化框架,通过分析后门关联在MLP层中的冗余编码,设计免疫启发的消除方法,通过合成后门变体和对比清洁版本,发现共享的后门签名,从而净化模型以抵御多种后门攻击。
Comments ICLR 2026