Skill-Conditioned Visual Geolocation for Vision-Language Models
基于技能的视觉地理定位用于视觉-语言模型
机构 * Southwest Jiaotong University(西南交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhejiang University(浙江大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出GeoSkill框架,通过技能图进化提升视觉语言模型的地理定位能力与自我进化能力,实验显示其在GeoRC任务中表现优异,且在外部数据集上具有良好的泛化能力。