arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2509.21990 2026-02-24 cs.CV cs.SD 91%

WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM

WAVE: 基于多模态大语言模型的学习统一且多功能的音频-视觉嵌入

Changli Tang, Qinfan Xiao, Ke Mei, Tianyi Wang, Fengyun Rao, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 WAVE通过联合多模态多任务训练方法,实现了统一且多功能的音频-视觉嵌入,显著提升了跨模态检索和问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12796 2026-02-24 cs.MM cs.SD eess.AS 88%

A Survey on Cross-Modal Interaction Between Music and Multimodal Data

多模态数据与音乐交叉交互的综述

Sifei Li, Mining Tan, Feier Shen, Minyan Luo, Zijiao Yin, Fan Tang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, Beijing, 100190, China. E-mail: S. Li School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, 100190, China. E-mail: F. Shen Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China. E-mail: .

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 本文综述了音乐与多模态数据的交叉交互,探讨了音乐在多模态学习中的作用,并提出了未来研究的方向。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18193 2026-02-24 cs.CV 83%

BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards

BLM-Guard:基于推理和政策对齐奖励的可解释多模态广告审核

Yiran Yang, Zhaowei Liu, Yuan Yuan, Yukun Song, Xiong Ma, Yinghao Song, Xiangji Zeng, Lu Sun, Yulu Wang, Hai Zhou, Shuai Cui, Zhaohan Gong, Jiefei Zhang

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BLM-Guard通过融合链式推理和政策对齐奖励,实现多模态广告的可解释性审核,提升审核的准确性与鲁棒性。

Comments 7 pages, 3 figures. To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02817 2026-02-24 cs.CL 79%

BOOM: Beyond Only One Modality KIT's Multimodal Multilingual Lecture Companion

BOOM: 超越单一模态的KIT多模态多语言讲座伴侣

Sai Koneru, Fabian Retkowski, Christian Huber, Lukas Hilgert, Seymanur Akti, Enes Yavuz Ugan, Alexander Waibel, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 BOOM通过多模态翻译技术,为多语言学习者提供同步的文本、幻灯片和语音输出,实现讲座内容的本地化与完整性保留。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19243 2026-02-24 cs.HC 78%

As Content and Layout Co-Evolve: TangibleSite for Scaffolding Blind People's Webpage Design through Multimodal Interaction

内容与布局共进化:通过多模态交互的TangibleSite用于辅助视障人士网页设计

Jiasheng Li, Zining Zhang, Zeyu Yan, Matthew Wong, Arnav Mittal, Ge Gao, Huaishu Peng

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 TangibleSite通过多模态交互帮助视障人士共同进化内容与布局,实现独立网页设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18618 2026-02-24 cs.CV 74%

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space

为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成

Aashish Chandra, Aashutosh A, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) Georgia Institute of Technology, USA(佐治亚理工学院,美国)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。

Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13632 2026-02-24 cs.CL cs.AI eess.AS 67%

Closing the Gap Between Text and Speech Understanding in LLMs

弥合语言模型中文本与语音理解之间的差距

Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

机构 * Université de Toulon, Aix Marseille Université, CNRS, LIS(法国图卢兹大学、马赛大学、CNRS、LIS)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 SALAD通过主动选择和跨模态蒸馏提高语音与文本对齐,以更高效的方式弥合LLMs在语音理解上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏