Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning
大语言模型后训练:一种统一的偏置学习与在线学习视角
机构 * Nankai University(南开大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)
AI总结 本文探讨了大语言模型后训练的统一框架,通过轨迹溯源划分偏置学习与在线学习两种模式,分析了支持扩展、策略重塑和行为固化等核心方法,强调系统设计协调性对进展的重要性。
Comments 38 pages, 1 figure, 8 tables