Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm
使用分布式GPU预训练大型语言模型:一种内存高效的分散式范式
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; OPPO Research Institute(OPPO研究院)
AI总结 提出SPES框架,通过分散式训练MoE LLM的子集专家降低内存需求,结合专家合并预热策略,在16个48GB GPU上训练2B参数模型,性能媲美集中式训练。