WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing
WhiFlash: 通过令牌级跨范式路由加速推测解码
机构 * Samsung AI Center, Cambridge, UK(三星AI中心,剑桥,英国)
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出WhiFlash,首个统一自回归与扩散并行草稿的跨范式推测解码方法,通过细粒度路由和缓存优化实现高达69.6%的吞吐量提升。
Comments Under review