Spiking the training data to correct for test set contamination
向训练数据注入噪声以校正测试集污染
机构 * University of Southern California(南加州大学)
AI总结 提出通过以已知比例故意污染部分测试样本(注入噪声)来校正测试集污染导致的分数膨胀,并利用记忆预测器进行统计校正。
高校专区
向训练数据注入噪声以校正测试集污染
机构 * University of Southern California(南加州大学)
AI总结 提出通过以已知比例故意污染部分测试样本(注入噪声)来校正测试集污染导致的分数膨胀,并利用记忆预测器进行统计校正。
扩展自监督语音模型揭示深层语言关系:来自太平洋集群的证据
机构 * School of Electrical Engineering, KAIST, Republic of Korea(韩国成均馆大学电气工程学院) ; Thomas Lord Department of Computer Science, University of Southern California, USA(美国南加州大学计算机科学系) ; Language Technologies Institute, Carnegie Mellon University, USA(美国卡内基梅隆大学语言技术研究所)
AI总结 通过将自监督语音模型的语言识别系统从126种扩展到4017种语言,发现系统在4K规模下发生质变,揭示出太平洋地区基因无关语言的宏观集群,表明大规模模型能内化多层语言历史。
Comments Accepted to Interspeech 2026