ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输
机构 * Can Tho University(金兰大学)
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。
Comments Preprint submitted to Expert Systems with Applications