Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
基于视觉语言模型的指令视频多模态抽象摘要
机构 * Beihang University, Beijing, China(北航大学,北京,中国) ; University of Verona, Italy(威尼斯大学,意大利)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。
Comments Accepted to ICPR 2026