Penguin-VL: Exploring the Efficiency Limits of VLM with LLM-based Vision Encoders
Penguin-VL:探索基于大语言模型的视觉编码器的效率极限
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 效率与部署 :LLM(title,abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。
Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL