2512.06392
2025-12-12
cs.LG
cs.AI
88%
RLAX: Large-Scale, Distributed Reinforcement Learning for Large Language Models on TPUs
RLAX:在TPUs上为大语言模型实现大规模分布式强化学习
Runlong Zhou, Lefan Zhang, Shang-Chen Wu, Kelvin Zou, Hanzhi Zhou, Ke Ye, Yihao Feng, Dong Yin, Alex Guillen Garcia, Dmytro Babych, Rohit Chatterjee, Matthew Hopkins, Xiang Kong, Chang Lan, Lezhi Li, Yiping Ma, Daniele Molinari, Senyu Tong, Yanchao Sun, Thomas Voice, Jianyu Wang, Chong Wang, Simon Wang, Floris Weers, Yechen Xu, Guolin Yin, Muyang Yu, Yi Zhang, Zheng Zhou, Danyang Zhuo, Ruoming Pang, Cheng Leong
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结
RLAX在TPUs上实现大规模分布式强化学习,通过参数服务器架构和新数据集筛选技术,提升大语言模型的推理能力。