Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches
并非所有标记都值得缓存:学习语义感知的淘汰策略用于LLM前缀缓存
机构 * Peking University(北京大学) ; FirestAI ; Tsinghua University(清华大学) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Southeast University(东南大学)
AI总结 本文提出了一种语义感知的前缀缓存淘汰策略SAECache,通过多队列架构、语义感知的标记加权机制和全适应的在线学习方案,提高了LLM服务中前缀缓存的效率,从而在不同工作负载下实现了显著的TTFT提升。