BlendServe: Optimizing Offline Inference for Auto-regressive Large Models with Resource-aware Batching
BlendServe: 利用资源感知批处理优化自回归大模型的离线推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Davis(加州大学戴维斯分校) ; Rice University(里士满大学)
AI总结 针对离线批处理中资源重叠与前缀共享的冲突,提出资源感知前缀树来最大化资源利用率,相比vLLM和SGLang吞吐量提升1.44倍。