arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-09 至 2026-03-09 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 13 篇

2504.00837 2026-03-09 cs.SD cs.AI cs.MM 87%

A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives

从单模态、跨模态和多模态视角综述音乐生成

Shuyu Li, Shulei Ji, Zihao Wang, Songruoyao Wu, Jiaxing Yu, Kejun Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(title);分类 cs.AI、cs.MM

AI总结 本文综述了多模态音乐生成的研究现状,探讨了多模态数据对齐、系统评估方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06530 2026-03-09 cs.CV 83%

AV-Unified: A Unified Framework for Audio-visual Scene Understanding

AV-Unified: 一个用于音频-视觉场景理解的统一框架

Guangyao Li, Xin Wang, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AV-Unified提出一个统一框架,通过多尺度时空感知网络和跨模态指导模块,实现音频-视觉场景理解任务的联合学习和高效处理。

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12436 2026-03-09 eess.AS cs.AI cs.LG cs.MM cs.SD 82%

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

在融合前净化:迈向无掩码的语音增强以实现鲁棒的音频-视觉语音识别

Linzhi Wu, Xingyu Zhang, Hao Yuan, Yakun Zhang, Changyan Zheng, Liang Xie, Tiejun Liu, Erwei Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新研究院) Peking University(北京大学) High-tech Institute(高新技术研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出了一种端到端的噪声鲁棒音频-视觉语音识别框架,结合语音增强技术,在无需显式生成噪声掩码的情况下提升鲁棒性。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 81%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 70%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 音频语音多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13127 2026-03-09 cs.CV cs.CR 70%

SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge

SPARK:通过协同提示音频与重新上下文化知识实现T2V模型的劫持

Zonghao Ying, Moyang Chen, Nizhang Li, Zhiqiang Wang, Wenxin Zhang, Quanchen Zou, Zonglei Jing, Aishan Liu, Xianglong Liu

机构 * State Key Laboratory of Complex \& Critical Software Environment, Beihang University College of Science, Mathematics Technology, Wenzhou-Kean University 360 AI Security Lab Faculty of Innovation Engineering, Macau University of Science Hong Kong University of Science University of Chinese Academy of Sciences

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 SPARK通过模块化提示设计,利用音频与视觉关联模式,实现对T2V模型的高效劫持,提升攻击成功率23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06542 2026-03-09 cs.SD cs.AI 57%

RAMoEA-QA: Hierarchical Specialization for Robust Respiratory Audio Question Answering

RAMoEA-QA:面向呼吸音频问答的分层专业化

Gaia A. Bertolino, Yuwei Zhang, Tong Xia, Domenico Talia, Cecilia Mascolo

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学) University of Calabria(卡拉布里亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 RAMoEA-QA通过分层专业化机制,统一处理多种呼吸音频问答任务,提升在不同领域和任务转换下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06373 2026-03-09 eess.AS 57%

Doctor or Patient? Synergizing Diarization and ASR for Code-Switched Hinglish Medical Conditions Extraction

医生还是病人?协同语音识别与说话人识别用于代码混合希金斯医疗条件提取

Séverin Baroudi, Yanis Labrak, Shashi Kumar, Joonas Kalda, Sergio Burdisso, Pawel Cyrta, Juan Ignacio Alvarez-Trejos, Petr Motlicek, Hervé Bredin, Ricard Marxer

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种端到端神经说话人识别与向量聚类方法,用于代码混合希金斯医疗条件提取,通过领域特定微调和错误校正,实现了较高的转录准确率,并在DISPLACE-M挑战中取得优异成绩。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05272 2026-03-09 cs.CL cs.HC 57%

Oral to Web: Digitizing 'Zero Resource'Languages of Bangladesh

口到网:数字化孟加拉国的‘零资源’语言

Mohammad Mamun Or Rashid

机构 * Bangladesh Computer Council(孟加拉国计算机委员会) Jahangirnagar University(贾hangirnagar大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文介绍了多语言云语料库,旨在为孟加拉国的濒危语言提供数字化资源,涵盖42种语言,通过系统田野工作和多模态数据收集,支持低资源NLP和语言保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05793 2026-03-09 cs.HC 50%

A Closed-Loop CPR Training Glove with Integrated Tactile Sensing and Haptic Feedback

闭环式带集成触觉感知与触觉反馈的CPR训练手套

Jaeyoung Moon, Mingzhuo Ma, Qifeng Yang, Youjin Choi, Seokhyun Hwang, Samuel Burden, Kyung-Joong Kim, Yiyue Luo

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出了一种闭环CPR训练手套,通过集成触觉感知和触觉反馈,提升自主练习中的CPR质量与准确性。

Comments 8pages, 10 figures, This paper is accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00789 2026-03-09 physics.app-ph physics.flu-dyn 50%

Aeroacoustic signatures reveal fast transient dynamics of vapor-jet-driven cavity oscillations in metallic additive manufacturing

气动声学特征揭示金属增材制造中蒸发喷射驱动腔体振荡的快速瞬态动力学

Haolin Liu, S. Kiana Naghibzadeh, Zhongshu Ren, Yanming Zhang, Jiayun Shao, Samuel J. Clark, Kamel Fezzaa, Xuzhe Zeng, Lin Gao, Wentao Yan, Noel Walkington, Kaushik Dayal, Tao Sun, Anthony D. Rollett, Levent Burak Kara

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 该研究通过气动声学特征揭示金属增材制造中蒸发喷射驱动的腔体振荡快速瞬态动力学,利用声学信号耦合瞬时腔体深度和振荡频率,重新定义蒸发过程的临界频率事件。

Comments 35 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07619 2026-03-09 cs.RO 50%

CAVER: Curious Audiovisual Exploring Robot

CAVER:好奇的视听探索机器人

Luca Macesanu, Boueny Folefack, Samik Singh, Ruchira Ray, Ben Abbatematteo, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CAVER是一种新型机器人,通过好奇心驱动的探索算法和多模态视听表示,提升材料分类和音频示范模仿的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14063 2026-03-09 cs.RO 50%

Language Conditioning Improves Accuracy of Aircraft Goal Prediction in Non-Towered Airspace

语言引导提升非塔台空域飞机目标预测的准确性

Sundhar Vinodh Sangeetha, Chih-Yuan Chiu, Sarah H. Q. Li, Shreyas Kousik

机构 * Georgia Institute of Technology(佐治亚理工学院) School of Aerospace Engineering(航空航天工程学院) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Mechanical Engineering(机械工程学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出利用语言信息提升非塔台空域飞机目标预测准确性的多模态框架,通过整合自然语言理解和空间推理,有效提高自主决策能力。

Comments The last two authors advised equally. Accepted to the 2026 IEEE International Conference on Robotics and Automation. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏