VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI
VocSegMRI:多模态学习在实时MRI中的精确声带段分割
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学) ; University of Maryland School of Dentistry(马里兰大学牙科学院) ; Harvard Medical School/Massachusetts General Hospital(哈佛医学院/麻省总医院) ; Universidad de Antioquia UdeA(安蒂奥基亚大学 UdeA) ; Johns Hopkins University(约翰霍普金斯大学) ; Leibniz University Hannover(汉诺威莱布尼茨大学)
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出VocSegMRI,通过跨注意力融合和对比学习目标,整合视频、音频和语音学输入,实现实时MRI中声带结构的精确分割,实验表明其优于单模态和多模态基线方法。
Comments Preprint submitted to MIDL short paper 2026