Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation
Tuna-2:像素嵌入在多模态理解和生成中优于视觉编码器
机构 * Meta AI ; The University of Hong Kong(香港大学) ; University of Waterloo(滑铁卢大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出Tuna-2,一种基于像素嵌入的统一多模态模型,通过直接使用像素嵌入进行多模态理解和生成,展示了统一像素空间建模在高质量图像生成中可以与潜在空间方法竞争,并证明了预训练视觉编码器在多模态建模中并非必要。
Comments Project page: https://tuna-ai.org/tuna-2