MLLM-Guided Semantic Correction for Text-to-Video Generation
基于多模态大语言模型(MLLM)的文本到视频生成语义修正
机构 * Zhejiang University(浙江大学) ; Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。