Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning
神经网络的机械可解释性:电路、稀疏特征和符号推理
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; VSB—Technical University of Ostrava(奥斯特拉瓦技术大学)
专题命中 逻辑推理 :reasoning(title);分类 cs.LG
AI总结 研究神经网络机械可解释性,通过Transformer电路分析、Sparse Autoencoders等工具应对叠加等挑战,探索控制模型行为方法,还将机械见解与神经符号人工智能框架联系,以实现神经网络内部算法逆向工程及可解释。
Comments 20 pages