Persistent Sparse Autoencoders: Learning Feature Timescales in Language Models
持久稀疏自动编码器:在语言模型中学习特征时间尺度
机构 * University of Cambridge(剑桥大学) ; University of Oxford(牛津大学)
AI总结 研究在语言模型中学习特征时间尺度的问题,提出持久稀疏自动编码器,通过为特征学习持久性系数扩展标准SAEs,实验表明其能保持竞争力的重建质量,为解释和监测语言模型带来新机会。