Emergent alignment and the projectability of ethical personas
涌现对齐与伦理人格的可投射性
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。