Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Mage-VL:一种高效的编解码器原生流式多模态基础模型
机构 * Microsoft(微软)
专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title);image-text(abstract);分类 cs.CV、cs.CL
AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。
Comments Project page: https://microsoft.github.io/Mage