FastTPS: An Optimized Method for LLM Token Phase for AI accelerators
FastTPS:一种针对人工智能加速器的大语言模型令牌阶段的优化方法
机构 * Anonymous Institution(匿名机构)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究针对LLMs推理令牌阶段低并行性问题,提出FastTPS方法,含无重新加载KV缓存串联、优化“RoPE”注意力、高度融合MLP及细粒度流水线调度,显著缓解内存瓶颈,提升推理速度与内存带宽利用率。
Comments 16 pages, 8 figures, 7 tables