Multimodal Speaker Identification in Classroom Environments
课堂环境中的多模态说话人识别
机构 * University of Michigan(密歇根大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 针对课堂背景噪声和儿童语音变异性导致纯声学模型准确率低的问题,提出融合声学嵌入与LLM语义上下文的多模态框架,将学生识别准确率从39.0%提升至50.3%,长句准确率达76.9%,角色区分准确率99.3%。
Comments 9 pages, 5 tables, 3 figures