In-Context Audio Control of Video Diffusion Transformers
上下文音频控制视频扩散变换器
机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) ; Kling Team, Kuaishou Technology(快手科技Kling团队)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。