EMO: Pretraining Mixture of Experts for Emergent Modularity
EMO:用于涌现模块化的专家混合预训练
机构 * University of California, Berkeley(加州大学伯克利分校) ; Allen Institute for AI(人工智能研究院)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。