TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Wuhan University(武汉大学)
专题命中 视频多模态 :cross-modal(title);分类 cs.CV
AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。