InverseScope: Scalable Activation Inversion for Interpreting Large Language Models
InverseScope:用于解释大语言模型的可扩展激活反演
机构 * School of Mathematical Science, Peking University(北京大学数学科学学院) ; School of Science, Westlake University(西湖大学理学院) ; Beijing International Center for Mathematical Research(北京国际数学研究中心) ; New Cornerstone Science Laboratory, Peking University(北京大学新基石科学实验室)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究大语言模型内部表征解释难题,提出InverseScope框架,通过输入反演解释神经激活,用新颖架构提高采样效率,揭示模型表征空间结构,可扩展到14B参数模型并推广到分布外输入。
Comments 12 pages