Let ViT Speak: Generative Language-Image Pre-training
让ViT说话:生成式语言-图像预训练
机构 * Beijing Jiaotong University(北京交通大学) ; ByteDance(字节跳动) ; Nanyang Technological University(南洋理工大学)
AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。
Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP