Priors in Time: Missing Inductive Biases for Language Model Interpretability
时间中的先验:语言模型可解释性中缺失的归纳偏置
机构 * Goodfire AI ; Independent(独立) ; SEAS, Harvard University(哈佛大学SEAS学院) ; EPFL(瑞士联邦理工学院) ; Kempner Institute at Harvard University(哈佛大学凯普内研究所) ; Department of Psychology, Stanford University(斯坦福大学心理学系) ; Department of Psychology, Harvard University(哈佛大学心理学系) ; Decode Research ; Boston University(波士顿大学)
AI总结 本文提出时序特征分析方法,通过引入时序归纳偏置,改进语言模型表示的可解释性,有效区分抽象与新颖信息,克服现有方法的局限。
Comments Preprint