PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning
PR2: 基于MoE的大语言模型强化学习中的预测性路由重放
机构 * Rutgers University(罗格斯大学) ; AMD ; MBZUAI
AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。
大厂专区
PR2: 基于MoE的大语言模型强化学习中的预测性路由重放
机构 * Rutgers University(罗格斯大学) ; AMD ; MBZUAI
AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。
UniLab: 超越GPU主导范式的机器人强化学习异构架构
机构 * THU(清华大学) ; SJTU(上海交通大学) ; SII(上海信息所) ; Motphys ; HITSZ(哈尔滨工业大学) ; BIT(北京理工大学) ; NEU(南京大学) ; SUSTech(四川大学) ; TJU(天津大学) ; DISCOVER Robotics ; HKUST(GZ)(香港科技大学(广州)) ; Galbot ; NUS(国立新加坡大学) ; WTU(武汉理工大学) ; HBUT(湖南大学) ; AMD ; NJU(南京大学) ; ZJU(浙江大学) ; Dexmal ; Sharpa ; D-Robotics
AI总结 提出UniLab异构CPU-仿真/GPU-学习架构,通过统一运行时解耦CPU并行仿真与GPU策略更新,在相同硬件配置下将端到端训练效率提升3-10倍,并减少对NVIDIA CUDA的依赖。