ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
ESsEN: 在低资源环境下训练紧凑的判别视觉-语言变换器
机构 * Department of Computer Science(计算机科学系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出ESsEN模型,通过双塔编码器结构和传统卷积网络,实现低资源环境下高效视觉-语言模型训练,实验表明其参数量仅为其他模型的分数,性能优异。