See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding
See What I Mean: 对齐视觉与语言表示以实现视频细粒度物体理解
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; NKIARI, Shenzhen Futian(深圳福田国家信息研究所)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出SWIM方法,通过对齐视觉和语言表示,仅从文本提示中实现细粒度物体理解,解决了传统方法需要显式视觉提示的问题,通过构建NL-Refer数据集和多层交叉注意力图提升文本-视觉对齐性能。
Journal ref CVPR 2026