arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-12 至 2026-03-12 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2505.17862 2026-03-12 cs.AI cs.CL cs.CV 87%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12583 2026-03-12 eess.AS cs.SD 83%

Robust Audio-Visual Target Speaker Extraction with Emotion-Aware Multiple Enrollment Fusion

鲁棒的音频视觉目标说话人提取与情感感知多注册融合

Zhan Jin, Bang Zeng, Peijun Yang, Jiarong Du, Wei Ju, Yao Tian, Juan Liu, Ming Li

机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS

AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10043 2026-03-12 cs.MM cs.AI cs.SD 81%

AMB-DSGDN: Adaptive Modality-Balanced Dynamic Semantic Graph Differential Network for Multimodal Emotion Recognition

AMB-DSGDN: 适应性模态平衡动态语义图差分网络用于多模态情感识别

Yunsheng Wang, Yuntao Shou, Yilong Tan, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(计算机与数学学院,中央南林业科技大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 AMB-DSGDN通过适应性模态平衡和动态语义图差分机制,提升多模态情感识别的准确性和鲁棒性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10465 2026-03-12 cs.SD cs.CV cs.HC 79%

MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR

MoXaRt: 基于音频视觉对象的XR声音交互

Tianyu Xu, Sieun Kim, Qianhui Zheng, Ruoyu Xu, Tejasvi Ravi, Anuva Kulkarni, Katrina Passarella-Ward, Junyi Zhu, Adarsh Kowdle

机构 * Google Mountain View CA USA(谷歌山景城) University of Michigan Ann Arbor MI USA(密歇根大学安 Arbor分校) Columbia University New York NY USA(哥伦比亚大学) Google San Francisco CA USA(谷歌旧金山)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 MoXaRt通过音频视觉线索分离交织声源,提升XR环境中的语音可懂度和社交参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23610 2026-03-12 cs.SD cs.CV 79%

Efficient Audio-Visual Speech Separation with Discrete Lip Semantics and Multi-Scale Global-Local Attention

高效音频-视觉语音分离与离散唇语语义及多尺度全局-局部注意力

Kai Li, Kejun Gao, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist,清华大学,北京) IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing(IDG/麦克戈文脑研究 institute,清华大学,北京) Chinese Institute for Brain Research (CIBR), Beijing(中国脑科学研究院(CIBR),北京)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 Dolphin通过离散唇语语义和多尺度全局-局部注意力实现高效音频-视觉语音分离,提升分离质量和效率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07696 2026-03-12 eess.AS 57%

Multi-View Based Audio Visual Target Speaker Extraction

基于多视角的音频视觉目标说话人提取

Peijun Yang, Zhan Jin, Juan Liu, Ming Li

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出多视角张量融合框架,通过多视角学习提升音频视觉目标说话人提取的性能与鲁棒性。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03542 2026-03-12 cs.CV 57%

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音到LaTeX:用于将语音方程和句子转换为LaTeX的新模型和数据集

Dmitrii Korzh, Dmitrii Tarasov, Artyom Iudin, Elvir Karimov, Matvey Skripkin, Nikita Kuzmin, Andrey Kuznetsov, Oleg Y. Rogov, Ivan Oseledets

机构 * AXXX MTUCI(莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) HSE University(俄罗斯高等经济大学) Applied AI Institute(应用人工智能研究所) Innopolis University(Innopolis大学) Moscow State University(莫斯科国立大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个开源大规模数据集和模型,用于将语音中的数学方程和句子转换为LaTeX,显著提升了转换精度。

Comments 22 pages, 2 figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 50%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏