DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs
DoubleHelix:结合大语言模型的视听语音识别结构化跨模态融合方法
专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 该研究针对视听语音识别跨模态融合缺乏结构化迭代优化的问题,提出DoubleHelix融合框架,通过三个组件实现迭代交互与退化感知增强,在LRS3数据集上大幅降低词错误率并提升噪声鲁棒性。
Comments ACM MM2026 ACCEPTED