BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching
BatchLLM: 通过全局前缀共享和面向吞吐量的令牌批处理优化大批次LLM推理
机构 * Microsoft(微软)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出BatchLLM,通过全局前缀共享和面向吞吐量的令牌批处理优化大批次LLM推理,提高GPU利用率。
Comments Accepted at MLSys 2026