Mechanistic Indicators of Understanding in Large Language Models
大语言模型中理解机制的指示器
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(联邦理工学院) ; Idiap Research Institute(Idiap研究所) ; University of Bern, Department of Philosophy(伯尔尼大学哲学系)
AI总结 本文提出一个分层框架,探讨大语言模型中理解的三个层次,通过机制可解释性揭示AI理解的机制与人类认知的异同。
Comments 38 pages