Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述
机构 * Tencent Hunyuan Team(腾讯文言团队)
专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。