Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
Audio-Omni: 扩展多模态理解到多功能音频生成与编辑
机构 * Hong Kong University of Science and Technology(香港理工大学) ; WeChat Vision, Tencent Inc(微信视觉,腾讯公司) ; Peking University(北京大学)
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。