Caption-Matching: A Multimodal Approach for Cross-Domain Image Retrieval
图像跨域检索:一种多模态方法
机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院电气与电子工程系)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出Caption-Matching方法,利用预训练视觉语言模型生成的图像描述作为中间表示,实现跨域图像检索,无需标注数据或进一步训练,在Office-Home和DomainNet上取得显著提升。