arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-08-04 至 2026-08-04 共收录 3
2608.01743 2026-08-04 cs.LG cs.CL 新提交

Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning

面向大语言模型强化学习中能力保留的可塑性保持KL正则化方法

Li Wang, Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团)

AI总结 针对LLM强化学习后训练中能力遗忘问题,提出CoKL正则化框架,可在目标任务改进与原有能力保留间实现更优平衡,优于现有正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏