How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift
大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究
机构 * University of Cambridge(剑桥大学)
专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。
Comments 21 pages, 7 figures (includes references and appendices)