Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs
Hessian-Enhanced Token Attribution (HETA): 解释自回归语言模型
机构 * Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) ; School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院) ; Department of Electrical Engineering and Computer Science, United States Military Academy(美国军事学院电子工程与计算机科学系)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 HETA提出了一种针对解码器-only语言模型的新型解释框架,结合语义过渡向量、Hessian敏感度评分和KL散度,提升上下文感知和因果解释能力,通过基准数据集验证其在生成任务中的优越性。
Comments Accepted at ICLR 2026