UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding
UniversalVTG: 一种通用且轻量的视频时间定位基础模型
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出UniversalVTG,一种通用轻量视频时间定位模型,通过大规模跨数据集预训练实现高效长视频定位,优于专用模型且比大语言模型更轻量。
Comments Project Page: https://vision.cs.utexas.edu/projects/universalvtg