Synthetic Persona Pretraining: Alignment from Token Zero
合成角色预训练:从零开始的对齐
机构 * EPFL(洛桑联邦理工学院) ; University of Toronto(多伦多大学) ; Northeastern University(东北大学) ; SJTU(上海交通大学) ; Saarland University(萨尔大学) ; Hereon(亥姆霍兹极地与海洋研究中心) ; TUHH(汉堡工业大学) ; Ontocord AI(Ontocord人工智能公司) ; TUC(德累斯顿工业大学) ; DFKI(德国人工智能研究中心)
AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。