Tracing Moral Foundations in Large Language Models
在大型语言模型中追溯道德基础
机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) ; Department of Psychology, University of Southern California(南加州大学心理学系) ; Center for Computational Language Sciences, University of Southern California(南加州大学计算语言科学中心)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)
AI总结 本文研究了大型语言模型中道德基础的编码、组织和表达,通过多层方法分析道德基础与人类道德感知的一致性,并发现道德结构在预训练和微调过程中自然形成,且部分解耦。