arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2604.26453 2026-04-30 cs.CV 89%

Attribution-Guided Multimodal Deepfake Detection via Cross-Modal Forensic Fingerprints

基于属性引导的多模态深度伪造检测:跨模态取证指纹

Wasim Ahmad, Wei Zhang, Xuerui Mao

机构 * School of Interdisciplinary Science, Beijing Institute of Technology, Beijing 100081, China(交叉学科学院,北京理工大学,北京100081,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出AMDD框架,通过跨模态取证指纹一致性损失,引导模型学习生成器特定的取证特征,提升多模态深度伪造检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26568 2026-04-30 cs.CL 74%

Multimodal LLMs are not all you need for Pediatric Speech Language Pathology

多模态大语言模型并非儿科言语语言病理学的全部需求

Darren Fürst, Sebastian Steindl, Ulrich Schäfer

机构 * Ostbayerische Technische Hochschule(奥斯特拜尔技术大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL

AI总结 本文提出一种分层方法对儿童语音障碍进行分类,通过微调语音表示模型和数据增强技术,提高了临床任务的性能,证明语音表示模型在各项任务中均显著优于基于大语言模型的最新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02731 2026-04-30 cs.SD cs.CV cs.MM 73%

Omni2Sound: Towards Unified Video-Text-to-Audio Generation

Omni2Sound:迈向统一的视频-文本到音频生成

Yusheng Dai, Zehua Chen, Yuxuan Jiang, Baolong Gao, Qiuhong Ke, Jianfei Cai, Jun Zhu

机构 * Tsinghua University(清华大学) Monash University(莫纳什大学) Shengshu AI(盛数人工智能)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Omni2Sound模型,解决视频-音频、文本-音频及联合视频-文本-音频生成中的数据稀缺与任务竞争问题,通过SoundAtlas数据集和三阶段训练策略实现统一生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15995 2026-04-30 eess.AS 57%

AILive Mixer: A Deep Learning based Zero Latency Automatic Music Mixer for Live Music Performances

AILive Mixer: 基于深度学习的零延迟自动音乐混音系统用于现场音乐表演

Devansh Zurale, Iris Lorente, Michael Lester, Alex Mitchell

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出一种基于深度学习的自动多轨音乐混音系统,用于现场表演,解决现场表演中通道受相邻乐器声 bleed 影响及音频-视频同步问题,实现零延迟混音。

Comments 5 pages, 4 figures, accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26252 2026-04-30 cs.CV 57%

OmniTrend: Content-Context Modeling for Scalable Social Popularity Prediction

OmniTrend: 内容-上下文建模用于可扩展的社会流行度预测

Liliang Ye, Guiyi Zeng, Yunyao Zhang, Yi-Ping Phoebe Chen, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉特罗布大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出OmniTrend框架,通过分离内容吸引力与上下文曝光,提升跨平台流行度预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26031 2026-04-30 cs.CV 57%

Report of the 5th PVUW Challenge: Towards More Diverse Modalities in Pixel-Level Understanding

第五届PVUW挑战赛报告:迈向像素级理解中的更多样化模态

Chang Liu, Henghui Ding, Nikhila Ravi, Yunchao Wei, Shuting He, Song Bai, Philip Torr, Leilei Cao, Jinrong Zhang, Deshui Miao, Xusheng He, Dengxian Gong, Zhiyu Wang, Mingqi Gao, Jihwan Hong, Canyang Wu, Weili Guan, Jianlong Wu, Liqiang Nie, Xingsen Huang, Yameng Gu, Xiaogang Yu, Xin Li, Ming-Hsuan Yang, Sijie Li, Jungong Han, Quanzhu Niu, Shihao Chen, Yuanzheng Wu, Yikang Zhou, Tao Zhang, Haobo Yuan, Lu Qi, Shunping Ji, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Haijun Zhang, Xudong Kang, Shutao Li, Jaeyoung Do

机构 * The Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 报告总结了2026年PVUW挑战赛的目标、数据集及顶级方法,通过三个专业赛道评估了在高约束条件下最先进模型的表现,展示了社区最新技术进展和未来研究方向。

Comments Official Report of the 5th PVUW Challenge on CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13421 2026-04-30 cs.SD eess.AS 57%

Explainable Detection of Machine Generated Music and Early Systematic Evaluation

可解释性地检测机器生成音乐及早期系统性评估

Yupei Li, Qiyang Sun, Hanqian Li, Lucia Specia, Björn W. Schuller

机构 * Imperial College London, Computing(帝国理工学院伦敦分校,计算机系) Shandong University(山东大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文通过多种模型评估机器生成音乐检测,揭示ResNet18在领域内和领域外测试中的最佳性能,提出未来研究方向以提升检测方法的鲁棒性和有效性。

Comments Accepted at Scientific report

Journal ref Sci Rep 16, 13757 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏