When Vision Misleads, Let Location Speak: A Worldwide Image Geo-Localization Method via Location Attention Mechanism and Large Multimodal Models
当视觉误导时,让位置说话:基于位置注意力机制和大多模态模型的全球图像地理定位方法
机构 * Henan Key Laboratory of Cyberspace Situation Awareness(河南省网络空间态势感知重点实验室) ; Information Engineering University(信息工程大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出TransGeoCLIP框架,通过位置注意力机制和大多模态模型,解决视觉相似图像导致的地理定位错误问题,在多个基准上显著提升定位精度。
Comments Submitted to IEEE Transactions on Multimedia in March 2026