MSAM: Multi-Semantic Adaptive Mining for Cross-Modal Drone Video-Text Retrieval
MSAM:多语义自适应挖掘用于跨模态无人机视频-文本检索
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) ; School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能、光学与电子学院(iOPEN))
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出MSAM方法,通过多语义自适应学习机制提升无人机视频-文本跨模态检索性能,采用细粒度交互和自适应语义构建模块增强特征表示鲁棒性。