Fine-grained CLIP fine-tuning with self-annotated region alignment
基于自标注区域对齐的细粒度CLIP微调
机构 * City University of Hong Kong(香港城市大学) ; Hong Kong University of Science & Technology(香港科技大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。