End-to-End Simultaneous Dysarthric Speech Reconstruction with Frame-Level Adaptor and Multiple Wait-k Knowledge Distillation
端到端的同时口吃语音重建与帧级适配模块及多视图知识蒸馏
机构 * University of Science and Technology of China(中国科学技术大学) ; iFlytek Co., Ltd.(科大讯飞股份有限公司)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
AI总结 本文提出端到端的同时口吃语音重建系统,通过帧级适配模块和多视图知识蒸馏模块,提升重建语音的鲁棒性和可懂度。
Comments Submitted to 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)
Journal ref 2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), Singapore, 2025, pp. 1092-1097