Towards Intrinsic Interpretability of Large Language Models:A Survey of Design Principles and Architectures
面向大语言模型内在可解释性的探索:设计原则与架构的综述
机构 * MOE Key Lab of Computational Linguistics, Peking University(计算语言学MOE实验室,北京大学) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) ; Nanjing University of Science and Technology(南京理工大学) ; Purdue University(普渡大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了大语言模型内在可解释性的发展,分类现有方法为五种设计范式,并讨论开放挑战与未来研究方向。
Comments Accepted to the Main Conference of ACL 2026. 14 pages, 4 figures, 1 table