RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse
RelayCaching: 通过解码KV缓存重用加速LLM协作
机构 * Beijing University of Posts(北京邮电大学) ; Tsinghua University, Beijing, China(清华大学) ; University of Electronic Science(电子科学大学) ; Peking University, Beijing, China(北京大学)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。