SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference
SpenseGPT: 面向LLM推理的实用一次性剪枝,支持稀疏和稠密GEMM
机构 * Snowflake AI Research(Snowflake AI研究) ; Seoul National University(首尔大学)
AI总结 提出Spense混合稀疏-稠密格式,将权重矩阵分为2:4稀疏和稠密区域,结合一次性剪枝方法SpenseGPT,在B200 GPU上实现高达1.2倍端到端解码加速,同时保持模型精度。