LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition
LRS-VoxMM:面向真实场景的音频视觉语音识别基准
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
AI总结 本文提出LRS-VoxMM基准,基于VoxMM数据集,通过预处理生成适合AVSR管道的样本,覆盖更广泛场景和声学条件,并提供噪声、回声和带宽限制的评估集,实验表明其比LRS3更难,视觉信息在音频退化时作用更显著。
Comments Technical report for the LRS-VoxMM dataset release. Project page: https://mm.kaist.ac.kr/projects/voxmm