FlashAccel: Leveraging High-Bandwidth Flash for High-Throughput LLM Inference
FlashAccel:利用高带宽闪存实现高吞吐量语言模型推理
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM推理受HBM容量限制问题,提出FlashAccel系统,将HBF集成到基于HBM的GPU中,通过架构支持、特殊数据布局及引入新管理层和编程模型,在100ms延迟约束下,提升了每GPU吞吐量和能源效率。