31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding
31.1 一种14.08至135.69token/s的基于逻辑的堆叠异常自由大语言模型加速器,具备块聚类权重压缩和自适应并行推测解码
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本文提出了一种基于55nm推测解码的LLM加速器,采用基于突起的面对面ReRAM-on-logic堆叠技术,通过局部旋转单元实现无异常低比特量化,结合块级向量量化减少权重EMA开销,并采用自适应并行推测解码方案提升资源和带宽利用率。