Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale
Relax:一种用于大规模多模态后训练的异步强化学习引擎
机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。
Comments 17 pages, 22 figures