MobileLLM-Flash: Latency-Guided On-Device LLM Design for Industry Scale Deployment
MobileLLM-Flash: 用于工业级部署的延迟引导设备端大语言模型设计
机构 * Meta AI
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出MobileLLM-Flash,通过硬件循环架构搜索在移动端延迟约束下设计高效的大语言模型,支持8k上下文长度,实现更快的预填和解码速度。
Comments Accepted to ACL Industry Track 2026