BLADE: Boundary-Expanded and Layer-Adaptive Dynamic Exit for Efficient LLM Reasoning
BLADE:用于高效大语言模型推理的边界扩展与层自适应动态出口
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 BLADE是一种轻量级框架,通过构建多粒度检查点、学习紧凑探测层子集等,在保持接近基线准确率的同时,减少大语言模型的推理计算与生成令牌量,提升了LLM推理效率。
Comments 8 pages