How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models
语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知
机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) ; Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。
Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904