Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment
Aura:通过基于VLM的语义对齐实现一致的多主体视频生成
机构 * Tencent Hunyuan(腾讯混元)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。
Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura