Scalable Circuit Learning for Interpreting Large Language Models
可扩展的电路学习用于解释大型语言模型
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 提出CircuitLasso方法,基于稀疏线性回归高效学习LLM中的稀疏电路,以SAE特征为单元,在保持结构准确性的同时大幅降低计算成本,并揭示语义特征传播机制。
Comments Accepted to the Mechanistic Interpretability Workshop at ICML 2026