From Texts to Scores: Tracing the Emergence of Essay Quality Representations in Large Language Models
从文本到分数:追踪大型语言模型中作文质量表征的出现
机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2 CT实验室) ; Institute of International Language Services Studies, Macau Millennium College(澳门 millennium 学院国际语言服务研究学院) ; School of Data Science and Information Engineering, Guizhou Minzu University(贵州民族大学数据科学与信息工程学院)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 通过线性探测等方法分析8个LLM在三个数据集上的隐藏表征,发现作文质量信息以线性可解码形式存在,并识别出与分数相关的神经元,揭示了LLM评分的内在机制。
Comments This is a preprint of a manuscript currently under peer review