Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs
Flash-dLLM:面向快速、内存高效的扩散大语言模型的IO感知KV缓存与并行解码
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
AI总结 Flash-dLLM提出IO感知融合KV缓存与自草拟验证并行解码,无需训练即加速扩散LLM推理,在GSM8K和HumanEval上分别比Elastic-Cache快5.1倍和11.0倍。
Comments Code available at: https://github.com/VILA-Lab/Flash-dLLM