MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding
MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器
机构 * Meta
专题命中 视频理解 :video understanding(title);分类 cs.CV
AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。
Comments Accepted to ECCV 2026