ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining
ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型
机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) ; Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)
AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。
Comments Interspeech 2026