A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference
一种用于高效边缘-云LLM推理的流水线协同推测解码框架
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 本文提出PicoSpec框架,通过异步流水线解决边缘协作中的等待问题,并引入稀疏压缩降低通信延迟,实现在边缘-云协同推理中的高效性能。
Comments 8 pages, 6 figures