Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比
机构 * Westcliff University(韦克利夫大学)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用