Recurrent Residual Quantization: A Progressive Multi-Precision Representation for LLMs
循环残差量化:面向大语言模型的渐进式多精度表示
机构 * Intel(英特尔)
AI总结 本文提出循环残差量化(RRQ)框架,可从单个检查点生成LLM的多种精度表示,构建速度比MatGPTQ快3.3倍,在6、8比特精度下表现有竞争力,代码将公开。
Comments NeurIPS 2026 submission; 14 tables, 1 algorithm, and no figures