arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-06-19 至 2026-06-19 共收录 3
2606.19797 2026-06-19 eess.AS cs.AI cs.SD eess.SP 新提交

Improving End-to-End Speech Recognition for Dysarthric Speech through In-Domain Data Augmentation

通过域内数据增强改进构音障碍语音的端到端语音识别

Paban Sapkota, Hemant Kumar Kathania, Sudarsana Reddy Kadiri, Shrikanth Narayanan

机构 * Department of Electronics and Communication Engineering, National Institute of Technology Sikkim, India(电子与通信工程系,印度尼特拉特技术学院Sikkim分校) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, Los Angeles, USA(信号分析与解释实验室(SAIL),美国南加州大学洛杉矶分校)

AI总结 针对构音障碍语音识别中数据稀缺和严重程度差异的问题,本文探索了四种数据增强方法(SRM、PM、FM、VTLP)对预训练Wav2Vec2模型进行微调,在不同严重程度上实现了显著的字错误率降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19793 2026-06-19 eess.AS cs.AI cs.LG cs.SD eess.SP 新提交

Systematic Study of Dysarthric Speech Recognition: Spectral Features and Acoustic Models

构音障碍语音识别的系统研究:频谱特征与声学模型

Paban Sapkota, Hemant Kumar Kathania, Mikko Kurimo, Sudarsana Reddy Kadiri, Shrikanth Narayanan

机构 * Department of Electronics and Communication Engineering, National Institute of Technology Sikkim, India(电子与通信工程系,印度尼特技术学院锡金分校) Department of Information and Communications Engineering, Aalto University, Finland(信息与通信工程系,阿尔托大学,芬兰) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, Los Angeles, USA(信号分析与解释实验室(SAIL),美国南加州大学洛杉矶分校)

AI总结 本文系统研究不同频谱特征与声学模型的组合,通过引入音高特征和优化训练帧重叠数,在F-TDNN模型上实现孤立词和句子识别相对提升4.65%和4.63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19828 2026-06-19 cs.CV 新提交

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

3D-PLOT-LLM: 用于三维大语言模型的部件级对象标记

Jintang Xue, Xinyu Wang, Yixing Wu, Jingwen Chen, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) Ohio State University(俄亥俄州立大学)

AI总结 提出3D-PLOT-LLM,通过重组输入标记流使部件可直接通过LLM词汇寻址,无需分割解码器或边界框,在部件级基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏