A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval
一段文本胜过千条标题:重新思考视觉-语言检索的文本监督
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。
Comments Accepted at the MUCG workshop, ECCV 2026