LUT-LLM: Efficient Large Language Model Inference with Memory-based Computations on FPGAs
LUT-LLM: 通过FPGA上的基于内存的计算实现高效的大型语言模型推断
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
AI总结 本文提出LUT-LLM,首个利用基于内存计算的FPGA加速器,通过向量量化部署10亿参数语言模型,提升FPGA效率以竞争GPU性能。
Comments Extended, 11 pages, FCCM 2026