CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space
CLAY:视觉相似性模拟能力在视觉-语言嵌入空间中的条件性
机构 * KAIST(韩国科学技术院)
AI总结 CLAY通过重构预训练视觉-语言模型的嵌入空间,实现基于文本条件的灵活相似性计算,提升多条件检索效率与准确性。
Comments CVPR 2026, Project page: https://sohwi-lim.github.io/CLAY