2606.12370
2026-06-11
cs.LG
cs.CL
新提交
62%
Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling
打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练
Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou
机构
*
Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)
专题命中
代码生成
:code generation(abstract);分类 cs.CL、cs.LG
AI总结
针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。