ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era
ESPnet3:基础模型时代可扩展语音与音频研究的基础设施
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Brno University of Technology(布拉格技术大学) ; Instituto Superior Técnico(技术高等研究院) ; Hanyang University(翰阳大学) ; Hitachi Astemo(日立阿美士多) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出ESPnet3框架,通过模块化系统架构、配置驱动的数据集组合和统一Python工作流,实现大规模语音音频研究的高效训练与扩展,显著降低工程开销。
Comments Accepted at Interspeech 2026