M4V: Multimodal Mamba for Efficient Text-to-Video Generation
M4V:用于高效文本到视频生成的多模态曼巴
机构 * Meituan(美团) ; University of Technology Sydney(技术大学悉尼分校) ; Beijing Jiaotong University(北京交通大学)
AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。
Comments CVPR 2026