Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述
机构 * Tencent Hunyuan Team(腾讯文言团队)
专题命中 视频多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。