2406.14294
2026-04-22
cs.SD
cs.AI
eess.AS
62%
DASB - Discrete Audio and Speech Benchmark
DASB - 离散音频与语音基准
Pooneh Mousavi, Jarod Duret, Darius Petermann, Artem Ploujnikov, Luca Della Libera, Anastasia Kuznetsova, Cem Subakan, Mirco Ravanelli
机构
*
Concordia University(康科迪亚大学)
;
Mila-Quebec AI Institute(蒙特利尔AI研究院)
;
Avignon Université(阿维尼昂大学)
;
Université de Montréal(蒙特利尔大学)
;
Université Laval(拉瓦尔大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Microsoft(微软)
;
Indiana University(印第安纳大学)
专题命中
音频语音多模态
:multimodal(abstract);分类 cs.AI、eess.AS
AI总结
本文提出DASB基准,用于评估离散音频token在语音、通用音频和音乐领域的表现,发现离散表示不如连续表示鲁棒,需精细调参,语义token优于声学token,但与连续特征仍有差距。