MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling
MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。