UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成
机构 * Beihang University(北京航空航天大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。
Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)
Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)