MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment
MoVA: 面向模块化长视频-文本对齐的非对称双投影学习
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。
Comments ECCV 2026