UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器
机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) ; Technical University of Iasi(雅西技术大学) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 其他安全 :alignment(abstract)
AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。
Comments Accepted at ECCV 2026