Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation
超越文本条件:面向视频生成的MLLM-DiT融合系统研究
机构 * Chinese Academy of Sciences(中国科学院) ; Microsoft Research(微软研究院) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学)
AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。