arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Li Auto(理想汽车)

2026-07-23 至 2026-07-23 共收录 1
2607.16339 2026-07-23 cs.AI 版本更新

LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models

LaCache:用于扩散大语言模型的精确缓存和精度自适应推理

Xingru Chen, Zelang Liang, Yongjia Ma, Jiqing Zhan, Shuling Yang, Lian Wen, Kun Zhan

机构 * Li Auto Inc.(理想汽车公司)

AI总结 研究针对扩散大语言模型算子级冗余问题,提出LaCache加速框架,通过无损缓存中间结果及集成FP8量化策略,无需训练,单独使用可实现约1.3倍端到端加速,与现有方法结合可达40.2倍加速且保持任务精度。

详情

展开后加载摘要…

URL PDF HTML 收藏