MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation
MoE$^2$-LoRA:当专家混合模型遇上专家混合风格的低秩自适应
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 研究探索MoE模型的参数高效微调方法,提出MoE$^2$-LoRA,通过双通道RCP模块耦合预训练专家专业化与任务适应性,引入全局专家池,在多MoE主干上评估,能保持通用能力并实现最优下游精度。
Comments Preprint, under review