FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
FLARE:完全整合视觉-语言表示以实现深度跨模态理解
机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) ; Nanjing University(南京大学) ; Peking University(北京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Zhongguancun Academy Beijing Key Laboratory of Data Intelligence and Security(中关村北京数据智能与安全重点实验室)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 FLARE通过全视觉-语言对齐与整合范式实现深度跨模态理解,提出文本引导视觉编码、上下文感知对齐解码、双语义映射损失和文本驱动VQA合成等核心方法,展现优于现有方法的性能与泛化能力。