Locality-Aware Redundancy Pruning for LLM Depth Compression
面向LLM深度压缩的局部感知冗余剪枝
机构 * University of Southern California(美国南加州大学) ; Neural Superintelligence Lab, MODULABS(MODULABS神经超级智能实验室) ; Seoul National University(首尔国立大学) ; Inha University(釜山大学)
AI总结 提出LoRP,一种基于表示局部性的无训练单次深度剪枝框架,通过引入表示局部性分数(RLS)来识别和剪除冗余层,在多种LLM上提升了困惑度和下游任务准确率。