Diffusion Large Language Models for Visual Speech Recognition
用于视觉语音识别的扩散大语言模型
机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。
Comments Code: https://github.com/JeongHun0716/dllm-vsr