Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning
真相层:在持续预训练中毒下的信念转变探究
机构 * Centre for Trusted Internet \& Community, National University of Singapore, Singapore
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG
AI总结 本研究揭示了持续预训练中虚假信息如何取代模型内部事实表示,通过实验发现中毒对模型信念的影响及可逆性,强调了对事实完整性进行监控的重要性。