Adapting MLLMs for Nuanced Video Retrieval
为精细化视频检索适应大语言模型
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。
Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website