arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-26 至 2026-03-26 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2509.13767 2026-03-26 cs.CV 83%

VocSegMRI: Multimodal Learning for Precise Vocal Tract Segmentation in Real-time MRI

VocSegMRI:多模态学习在实时MRI中的精确声带段分割

Daiqi Liu, Johannes Enk, Maureen Stone, Fangxu Xing, Tomás Arias-Vergara, Jerry L. Prince, Jana Hutter, Jonghye Woo, Andreas Maier, Paula Andrea Pérez-Toro

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃朗根-纽伦堡大学) University of Maryland School of Dentistry(马里兰大学牙科学院) Harvard Medical School/Massachusetts General Hospital(哈佛医学院/麻省总医院) Universidad de Antioquia UdeA(安蒂奥基亚大学 UdeA) Johns Hopkins University(约翰霍普金斯大学) Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出VocSegMRI,通过跨注意力融合和对比学习目标,整合视频、音频和语音学输入,实现实时MRI中声带结构的精确分割,实验表明其优于单模态和多模态基线方法。

Comments Preprint submitted to MIDL short paper 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 79%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23673 2026-03-26 eess.AS cs.SD 70%

Crab: Multi Layer Contrastive Supervision to Improve Speech Emotion Recognition Under Both Acted and Natural Speech Condition

Crab:多层对比监督以提升在表演和自然语音条件下的语音情感识别

Lucas H. Ueda, João G. T. Lima, Paula D. P. Costa

机构 * Dept. of Computer Engineering and Automation (DCA), Faculdade de Engenharia Elétrica e de Computação(计算机工程与自动化系(DCA)、电气与计算机工程学院) AI Lab.(人工智能实验室) Institute of Computing, Universidade Estadual de Campinas, UNICAMP(计算学院,坎皮纳斯州立大学,UNICAMP)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出Crab模型,通过多层对比监督策略提升语音情感识别在表演和自然语音条件下的性能,采用跨模态Transformer架构和多任务对比学习,有效解决类别不平衡问题。

Comments IEEE Transactions on Affective Computing submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20072 2026-03-26 cs.CL 57%

From Text to Talk: Audio-Language Model Needs Non-Autoregressive Joint Training

从文本到谈话:音频-语言模型需要非自回归联合训练

Tianqiao Liu, Xueyi Li, Hao Wang, Haoxuan Li, Zhichao Chen, Weiqi Luo, Zitao Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) TAL Education Group(TAL教育集团) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Text-to-Talk模型,通过整合自回归文本生成与非自回归音频扩散,统一训练目标,提升多模态语音交互系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏