SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
SD-MVSum:基于脚本的多模态视频摘要方法与数据集
机构 * CERTH-ITI Thermi(CERTH-ITI热米)
专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出SD-MVSum方法及两个大规模数据集,通过引入加权跨模态注意力机制,结合脚本与视频音频内容提升摘要相关性,验证了方法在脚本驱动视频摘要中的有效性。
Comments Under review