Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM
Fast-dVLM: 通过直接转换自回归VLM实现高效的块扩散VLM
机构 * The University of Hong Kong(香港大学) ; NVIDIA(英伟达) ; MIT(麻省理工学院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 本文提出Fast-dVLM,通过直接转换自回归VLM实现高效的块扩散VLM,采用KV-cache兼容并行解码和推测块解码,提升推理效率。实验表明其生成质量与自回归模型相当,且通过SGLang和FP8量化实现6倍以上的推理加速。