Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning
面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法
机构 * Meituan(美团)
AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。
大厂专区
面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法
机构 * Meituan(美团)
AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。
从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏
机构 * Tianjin University(天津大学) ; Meituan(美团)
AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。