GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding
GeoDiT:一种基于扩散的视觉-语言模型,用于地理空间理解
机构 * College of Computer Science and Technology, Jilin University, Changchun 130012, China(吉林大学计算机科学与技术学院,长春 130012,中国) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
专题命中 空间理解 :spatial understanding(title,abstract);分类 cs.CV
AI总结 本文提出GeoDiT,一种基于扩散的视觉-语言模型,用于地理空间理解。该模型通过并行细化过程实现整体粗到细的合成,解决了传统自回归模型在结构化输出生成中的不足。