Interpretable Embeddings with Sparse Autoencoders: A Data Analysis Toolkit
使用稀疏自动编码器的可解释嵌入:一种数据分析工具包
机构 * University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究针对大规模文本语料库分析难题,提出用稀疏自动编码器创建SAE嵌入,经四个任务验证其比大语言模型更具性价比、比密集嵌入更可控,通过案例研究展示其在研究模型行为上的作用,是用于非结构化数据分析的通用工具。
Comments ICML 2026. Project page and code: https://interp-embed.com