Efficient, VRAM-Constrained xLM Inference on Clients
高效、受限于VRAM的xLM客户端推断
机构 * Microsoft Corporation(微软公司) ; NVIDIA Corporation(英伟达公司)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。
Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae