Shape Mutating Expert Compression:LorExperts and BTExperts
形状变异专家压缩:LorExperts与BTExperts
机构 * Advanced Micro Devices(超威半导体公司)
AI总结 本文针对混合专家(MoE)语言模型的专家权重压缩问题,提出LorExperts与BTExperts方法,在保留所有专家与原始路由的前提下实现约50%专家压缩,性能优于基线且随专家数量增长优势更显著。
大厂专区
形状变异专家压缩:LorExperts与BTExperts
机构 * Advanced Micro Devices(超威半导体公司)
AI总结 本文针对混合专家(MoE)语言模型的专家权重压缩问题,提出LorExperts与BTExperts方法,在保留所有专家与原始路由的前提下实现约50%专家压缩,性能优于基线且随专家数量增长优势更显著。
FlashRT:用于引导智能体部署实时多模态应用的智能体框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; AMD(超威半导体公司) ; University at Buffalo(纽约州立大学水牛城分校)
AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。