Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition
基于最优传输的基于大语言模型的视听语音识别语义对齐
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。