OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
OmniNFT: 多模态联合音频视频生成的模态感知强化学习
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; JD Explore Academy(京东探索研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。
Comments Project page: https://zghhui.github.io/OmniNFT/