LongCat-AudioDiT: High-Fidelity Diffusion Text-to-Speech in the Waveform Latent Space
LongCat-AudioDiT:在波形潜在空间中实现高保真的扩散文本到语音
机构 * Meituan LongCat Team(美团LongCat团队)
AI总结 LongCat-AudioDiT通过在波形潜在空间中直接操作,实现了高保真的文本到语音生成,无需复杂多阶段训练流程或高质量标注数据,展现出卓越的零样本语音克隆性能。
Comments Code and model weights are available at https://github.com/meituan-longcat/LongCat-AudioDiT