Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
为什么强化学习能够泛化?对大语言模型后训练的特征层面机制研究
机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; Saarland University(萨尔兰大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)
AI总结 研究通过对比强化学习与监督微调在大语言模型中的表现,揭示其泛化机制,发现强化学习通过持续演变的特征保持基模型表示,而监督微调引入稳定但专用的特征。
Comments ACL 2026 Main Conference