CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model
CASA:结合语音编码器与大语言模型的内容-语音口语评估
机构 * Aalto University(阿尔托大学) ; University of Helsinki(赫尔辛基大学) ; Walton Institute(沃尔顿研究所)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。
Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa