arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Meituan(美团)

2026-07-21 至 2026-07-21 共收录 1
2604.26256 2026-07-21 cs.LG cs.DC 版本更新

DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training

DORA:一种用于语言模型训练的可扩展异步强化学习系统

Tianhao Hu, Xiangcheng Liu, Yuchun Miao, Youshao Xiao, Hongyu Zang, Yang Zheng, Xuan Huang, Jinrui Ding, Yufei Zhang, Yu Yang, Yi-Kai Zhang, Yueqing Sun, Chengcheng Han, Xiandi Ma, Wei Wang, Qi Gu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan, China(美团(中国))

AI总结 DORA通过算法-系统协同设计解决异步训练中长尾轨迹问题,提升训练效率并保持收敛性,实验表明其在开源基准和工业应用中均显著提升强化学习训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏