AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
机构 * ServiceNow ; York University(约克大学) ; Mila – Quebec AI Institute(魁北克人工智能研究院) ; École de Technologie Supérieure(魁北克高等技术学院) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; University of Waterloo(滑铁卢大学) ; CIFAR AI Chair(CIFAR人工智能 chair) ; Polytechnique Montréal(蒙特利尔理工学院) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 文档图表理解 :vision-language model(abstract)