Value Drifts: Tracing Value Alignment During LLM Post-Training
价值漂移:在大语言模型训练后追踪价值对齐
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Université de Montréal(蒙特利尔大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究大语言模型训练后价值对齐问题,通过实验区分训练后算法和数据集影响,测量价值漂移,发现SFT阶段确立模型价值,后续偏好优化难重对齐,不同算法在偏好数据不变时也有不同结果,为相关选择提供见解。
Comments TACL 2026