Scalable Pretraining of Large Mixture of Experts Language Models on Aurora Super Computer
在Aurora超级计算机上可扩展地预训练大型专家混合语言模型
机构 * Parallel Computing Lab (India) Intel Corporation(英特尔公司印度并行计算实验室)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)
AI总结 本文在Aurora超级计算机上展示了大规模预训练大型语言模型,开发了Optimus训练库,预训练了多个MoE模型,并通过定制GPU内核和新型EP-Aware分片优化器提升了训练效率。