CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性
机构 * KAIST(韩国科学技术院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。
Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY