Foundry: Template-Based CUDA Graph Context Materialization for Fast LLM Serving Cold Start
Foundry:基于模板的CUDA图上下文材料化用于快速LLM服务冷启动
机构 * University of Michigan(密歇根大学) ; UC Berkeley(加州大学伯克利分校) ; Duke(杜克大学)
AI总结 Foundry通过模板化CUDA图上下文材料化,减少LLM服务冷启动延迟,提升启动速度并保持吞吐量。