Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model
基于Style-Diffusion TTS模型潜在空间适配的零样本人脸到语音合成
专题命中 个性化与一致性 :diffusion(title,title_cn)
AI总结 该研究提出基于StyleTTS 2的人脸到语音合成框架,通过人脸适配器实现静态人脸到语音的零样本生成,在LRS3数据集上验证了效果,且映射具有语言无关性。
Comments 5 pages, 1 figure, 5 tables, submitted to IberSPEECH 2026