Quantize the Target, Quantize the Drafter: Efficient Inference with Qwen3.5-4B
量化目标,量化草稿生成器:使用Qwen3.5 - 4B进行高效推理
机构 * Nota Inc.(Nota公司)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 研究旨在在资源受限的NVIDIA A10G GPU上实现Qwen3.5 - 4B的低延迟服务。核心方法是结合量化目标模型与推测性解码,通过量化感知蒸馏恢复精度,训练专用草稿生成器加速解码,还用量化等减少开销。贡献是实现加速并满足质量阈值,排名第三。
Comments All authors contributed equally. Our submission to Efficient Qwen Competition, ICML 2026 Workshop on AdaptFM