ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models
ReasonAlloc: 推理模型的分层解码时KV缓存预算分配
机构 * Tsinghua University(清华大学) ; City University of Hong Kong(香港城市大学) ; Peking University(北京大学) ; Shenzhen University of Advanced Technology(深圳理工大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。