SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
SAEVerbalizer:通过表示 verbalization 为稀疏自编码器特征生成解释
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; Fudan University(复旦大学)
AI总结 该研究提出 SAEVerbalizer 框架,通过微调 LLM 下游层生成 SAE 特征的自然语言解释,解决了传统解释方法的表面性与低效率问题,其 verbalization 能力可泛化、迁移并扩展到不同 LLM 的 SAE 特征。