Scalable Multilingual Multimodal Machine Translation with Speech-Text Fusion
可扩展的多语言多模态机器翻译与语音-文本融合
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL
AI总结 本文提出一种语音引导的机器翻译框架,通过融合语音和文本提升多语言翻译性能,并在多个基准上取得新突破。
Comments Accepted in ICLR 2026