Beyond Language Modeling: An Exploration of Multimodal Pretraining
超越语言模型:多模态预训练的探索
机构 * FAIR, Meta(FAIR、Meta) ; New York University(纽约大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 本文通过多模态预训练探索,揭示了视觉与语言数据的互补性及统一预训练对世界建模的促进作用,并提出MoE架构解决多模态扩展的不对称性问题。
Comments Project website at https://beyond-llms.github.io/