LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability
LLM作为具有注意力机制的NTM及话题建模作为长输入生成:可解释性与长上下文能力
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Science and Technology Beijing(北京科技大学) ; Beijing Value Simplex Technology Co. Ltd(北京价值简单科技有限公司) ; Zhongguancun Laboratory(中关村实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 本文从白盒和黑盒视角研究基于LLM的话题建模,提出注意力引导框架恢复可解释结构,并通过长输入任务和信号补偿方法提升性能,验证LLM与NTM的联系及长上下文LLM在话题建模中的潜力。