When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference
当NPU并非总是更快:移动LLM推理的阶段级分析
机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿先进计算机科学研究所)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过OPMASK控制管道分解方法,在CPU-NPU异构SoC上对移动LLM推理进行阶段感知的多级基准测试,发现Prefill阶段CPU比NPU快1.6倍,Decode阶段NPU仅提供1.05-1.2倍加速,且NPU卸载增加能耗高达51%。