Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models
Scene-VLM:通过视觉-语言模型进行多模态视频场景分割
机构 * Ben-Gurion University(本·古里安大学) ; Amazon Prime Video(亚马逊Prime视频) ; Tel-Aviv University(特拉维夫大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV
AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。
Comments Accepted for publication at CVPR 2026