ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache
ForkKV: 通过写时复制的 disaggregated KV 缓存实现多LoRA代理服务的扩展
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(abstract);分类 cs.LG
AI总结 ForkKV通过写时复制机制解耦KV缓存,解决多LoRA代理服务中的内存瓶颈问题,提升吞吐量3倍且不影响生成质量。