Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments The code will be available at https://github.com/Yangyi-Chen/PRIOR