MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation
MAViD:一种多模态框架用于音频-视觉对话理解和生成
机构 * Tsinghua University(清华大学) ; Meituan(美团)
专题命中 视频问答 :video generation(abstract);long video(abstract);分类 cs.CV
AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。