Improving Joint Audio-Video Generation with Cross-Modal Context Learning
通过跨模态上下文学习提升联合音频视频生成
机构 * Vivix Group Limited(维维克斯集团有限公司)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。