M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking
M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; Meituan, Shenzhen, China(美团(深圳,中国)) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。