FireRedTTS3: Unified Speech Generation and Editing with Semantically Enriched Speech Representations
FireRedTTS3:基于语义丰富的语音表征的统一语音生成与编辑
机构 * Xiaohongshu(小红书)
AI总结 本研究提出FireRedTTS3框架,利用冻结音频编码器正则化特征空间缓解自回归误差,其两个变体在对应任务数据集上均优于竞争系统,实现稳定可控的高保真语音生成与编辑。
大厂专区
FireRedTTS3:基于语义丰富的语音表征的统一语音生成与编辑
机构 * Xiaohongshu(小红书)
AI总结 本研究提出FireRedTTS3框架,利用冻结音频编码器正则化特征空间缓解自回归误差,其两个变体在对应任务数据集上均优于竞争系统,实现稳定可控的高保真语音生成与编辑。