LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference
LAST:最后一个查询令牌指导视觉令牌剪枝用于边缘-云协作多模态大语言模型(MLLM)推理
专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出无训练框架LAST,利用边缘侧VLM的最后查询令牌注意力实现查询感知视觉令牌剪枝,在11个多模态基准上以12.5%视觉令牌保留率维持95.4%全令牌准确率,降低边缘和云侧开销。