X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference
X-Cache:跨块块缓存用于少步自回归世界模型推理
机构 * AI Infra Team, XPeng Inc.(AI基础设施团队,小鹏汽车)
AI总结 本文提出X-Cache,一种无需训练的加速方法,通过跨连续生成块缓存而非去噪步骤来提升少步自回归世界模型的推理效率,实现71%的块跳过率和2.6倍的速度提升,同时保持最小的性能下降。
Comments Technical Report