arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

PAPERDAILY REPORTS

上交大等提出ReCache,智能体工具调用KV内存减少92.43%

arXiv 2608.19662 cs · cs.CL

智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。

在7个公开工具和技能数据集组成的基准上,资源级注意力的调用Inv-F1为82.3%,密集注意力为82.4%;首Token时间提速3.655倍。完整框架将分配的KV张量内存减少92.43%,注意力计算提速1.423倍。

同一工具换个顺序,普通前缀缓存就难复用

语言模型服务通常缓存提示词前缀的键值状态。两次请求若共享完全相同的开头,就不必重新计算。但智能体会根据任务检索不同工具:一次是天气加日历,下一次可能是日历加邮件。内容相同,顺序和组合却不同。

标准自注意力还会让一个工具Schema依赖前面出现的其他工具。天气工具在不同组合中得到的KV表示不再一致,无法直接从缓存拼装。工具越多、说明越长,重复编码成本越明显。

ReCache把资源级注意力、结构剪枝和语义剪枝组合起来

ReCache先为每份资源建立组合不变表示,再按调用贡献选择可见字段。

ReCache将工具、技能和其他可调用描述统一视为资源。目标不是压缩用户问题,而是把反复出现、结构稳定的资源说明从每次请求中拆出来。

局部位置让每份资源独立成块

资源级注意力取消不同资源之间的交叉连接,并给每份资源使用自己的局部位置编号。无论天气工具出现在第1个还是第8个位置,它内部的Token关系保持不变,因此能生成组合不变的KV块。

查询Token仍可查看被选中的资源。模型需要决定调用哪个工具时,会读取工具名、参数和说明;只是各资源在预编码阶段不再互相改写表示。缓存可以按资源标识存储,再根据当前检索结果拼装。

结构剪枝进一步在层、KV头组和字段之间选择贡献较高的路径。语义剪枝保留资源名、参数名、参数说明和必要后缀,删除对调用判断贡献较低的长文本。

不同配置下分配的KV缓存内存对比

论文的效率实验显示,逐步加入选择与剪枝后,KV张量内存显著下降。

剪枝对象是模型推理时的资源表示,不是永久修改原始工具文档。系统仍需保存完整Schema,以便缓存重建、版本更新和调用校验。

调用效果基本持平,首Token明显加快

论文基准汇集7个公开工具与技能使用数据集,并包含资源不重叠测试,检查模型遇到新工具组合时是否仍能调用正确。资源级注意力获得82.3% Inv-F1,密集方案为82.4%,差距0.1个百分点。

首Token时间获得3.655倍加速,说明请求到达后少做了大量重复Schema编码。完整压缩方案把已分配KV张量内存减少92.43%,注意力阶段提速1.423倍。

ReCache对首Token时间的实验比较

首Token指标反映资源预编码与缓存复用对请求启动阶段的影响。

不同数字对应不同实验层面,不能把3.655倍写成完整端到端吞吐提升。实际服务还包含检索、网络、工具执行和答案生成,工具调用本身若耗时数秒,模型侧节省的比例会下降。

部署下一步:缓存需要跟随工具版本管理

ReCache适合工具数量多、Schema长且跨请求重复的智能体平台。企业内部Agent经常加载数据库、工单、文档和审批接口,资源级缓存能减少相同说明反复占用显存。

结构预算变化与调用表现之间的关系

预算分析用于确定压缩程度与工具调用准确率的折中。

部署难点是版本一致性。参数名、必填项或权限说明一旦修改,对应缓存块必须失效;否则模型可能依据旧Schema生成错误调用。资源标识应包含内容摘要和权限上下文,不能只按工具名称复用。

下一步还要测试更长的企业Schema、动态生成工具和多租户权限隔离。论文证明了可复用表示的效率空间,生产系统仍需把缓存命中率、更新频率和错误调用率放在同一套监控中。

参考资料

https://arxiv.org/abs/2608.19662

https://github.com/EIT-NLP/ReCache