Superposition Without Interference? Towards Isolated Interventions via Almost Orthogonal Features in Language Models
通过语言模型中几乎正交的特征实现孤立干预
专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究基于机械可解释性前提,针对语言模型特征纠缠问题,受“独立因果机制”启发,提出将内部特征约束为几乎正交,通过形式化问题、界定干扰传播并关联正则化,实现对数学推理概念更孤立的干预且保留模型性能。
Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026