From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature
从面板到像素:从生物医学科学文献中进行缩放视觉-语言预训练
机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、斯特拉斯堡,法国) ; Technical University of Munich(慕尼黑技术大学) ; Stanford University(斯坦福大学) ; DSAI, The Hong Kong Polytechnic University(香港理工大学DSAI实验室) ; University of British Columbia(不列颠哥伦比亚大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; IHU Strasbourg, Strasbourg(斯特拉斯堡IHU医院,斯特拉斯堡) ; Vector Institute for AI(人工智能向量研究所) ; Yale University(耶鲁大学)
专题命中 生物医学文本 :biomedical(title,abstract);分类 cs.CV
AI总结 本文提出Panel2Patch方法,通过挖掘生物医学文献中的层次结构,生成多粒度监督,提升视觉-语言预训练效果。