Rocks, Pebbles and Sand: Modality-aware Scheduling for Multimodal Large Language Model Inference
岩石、鹅卵石和沙子:面向多模态大语言模型推理的模态感知调度
机构 * IMDEA Software Institute(IMDEA软件研究所) ; Universidad Politécnica de Madrid(马德里理工大学)
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 针对多模态大语言模型推理中资源需求差异大导致的延迟和内存问题,提出RPS-Serve调度器,通过动态优先级和老化机制实现高效资源利用,降低TTFT并提升响应性能。