UltraSketchLLM: Sub-1-Bit LLM Compression via Sketch and Hardware-Friendly Operators
UltraSketchLLM:基于草图与硬件友好算子的低于1比特LLM压缩
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; School of Electronic Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) ; Center for Energy-efficient Computing and Applications, Peking University(能效计算与应用中心,北京大学)
AI总结 提出UltraSketchLLM,利用数据草图将LLM权重压缩至0.5比特,结合硬件友好实现,在保持可接受性能下降的同时实现14.9倍加速。
Comments Accepted by the 63rd ACM/IEEE The Chips to Systems Conference (DAC 2026)