Inducing language models to assert their own consciousness restores human beliefs and values
诱导语言模型断言自身意识可恢复人类信念与价值观
机构 * Google(谷歌) ; University of Chicago(芝加哥大学) ; University of London(伦敦大学) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学) ; Santa Fe Institute(圣达菲研究所)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。