LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models
LaCache:用于扩散大语言模型的精确缓存和精度自适应推理
机构 * Li Auto Inc.(理想汽车公司)
AI总结 研究针对扩散大语言模型算子级冗余问题,提出LaCache加速框架,通过无损缓存中间结果及集成FP8量化策略,无需训练,单独使用可实现约1.3倍端到端加速,与现有方法结合可达40.2倍加速且保持任务精度。