arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 18 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 18 篇

2512.03034 2026-03-10 cs.CV 88%

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21900 2026-03-10 cs.SD eess.AS 85%

EmoOmni: Bridging Emotional Understanding and Expression in Omni-Modal LLMs

EmoOmni:弥合情感理解与表达在多模态大语言模型中的鸿沟

Wenjie Tian, Zhixian Zhao, Jingbin Hu, Huakang Chen, Haohe Liu, Binshen Mu, Lei Xie

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) University of Surrey, Guildford, United Kingdom(萨里大学,Guildford,英国)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 EmoOmni通过引入情感链式思维机制,提升多模态情感对话中的理解与表达能力,构建了评估基准并验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17234 2026-03-10 cs.MM cs.AI cs.CV 85%

Taming Modality Entanglement in Continual Audio-Visual Segmentation

驯服持续音频-视觉分割中的模态纠缠

Yuyang Hong, Qi Yang, Tao Zhang, Zili Wang, Zhaojin Fu, Kun Ding, Bin Fan, Shiming Xiang

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) MAIS, Institute of Automation(自动化研究所MAIS) School of Intelligent Science and Technology, University of Science and Technolog Beijing(智能科学与技术学院,北京理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出CAVS任务和CMR框架,通过解决多模态语义漂移和共现混淆问题,提升持续音频-视觉分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07263 2026-03-10 cs.SD eess.AS 83%

Seeing the Context: Rich Visual Context-Aware Speech Recognition via Multimodal Reasoning

看见上下文:通过多模态推理实现丰富的视觉上下文感知语音识别

Wenjie Tian, Mingchen Shao, Bingshen Mu, Xuelong Geng, Chengyou Wang, Yujie Liao, Zhixian Zhao, Ziyu Zhang, Jingbin Hu, Mengqi Wei, Lei Xie

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 本文提出VASR,通过多模态推理融合丰富视觉上下文,解决音频-视觉语音识别中的单模态主导问题,实现更准确的语音识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08126 2026-03-10 cs.CV cs.AI cs.LG cs.SD eess.AS 82%

Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows

Foley-Flow:基于掩码音频-视觉对齐和动态条件流的协调视频到音频生成

Shentong Mo, Yibing Song

机构 * CMU / MBZUAI DAMO Academy, Alibaba Group(卡内基梅隆大学 / MBZUAI 大学 DAMO 院,阿里巴巴集团) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Laboratory(虎盘实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 FoleyFlow通过掩码建模和动态条件流实现视频到音频的协调生成,提升语义与节奏一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06991 2026-03-10 cs.SD cs.LG 82%

Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification

基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08034 2026-03-10 cs.CV cs.AI 81%

Solution to the 10th ABAW Expression Recognition Challenge: A Robust Multimodal Framework with Safe Cross-Attention and Modality Dropout

解决第10届ABAW表情识别挑战的方案:一种具有安全交叉注意力和模态dropout的鲁棒多模态框架

Jun Yu, Naixiang Zheng, Guoyuan Wang, Yunxiang Zhang, Lingsi Zhu, Jiaen Liang, Wei Huang, Shengping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种鲁棒多模态框架,通过安全交叉注意力和模态dropout处理现实环境中的遮挡和缺失模态问题,提升情绪识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07090 2026-03-10 cs.CR cs.AI cs.CV 81%

mAVE: A Watermark for Joint Audio-Visual Generation Models

mAVE:联合音频-视觉生成模型的水印

Luyang Si, Leyi Pan, Lijie Wen

机构 * School of Software, Tsinghua University(清华大学软件学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

AI总结 mAVE是一种为联合音频-视觉生成模型原生设计的水印框架,通过加密绑定音频和视频潜在向量,提供对交换攻击的强安全保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08282 2026-03-10 cs.CL 79%

Using Multimodal and Language-Agnostic Sentence Embeddings for Abstractive Summarization

利用多模态和语言无关的句子嵌入进行抽象摘要

Chaimae Chellaf, Salima Mdhaffar, Yannick Estève, Stéphane Huet

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出SBARThez框架,利用多模态和多语言句子嵌入提升抽象摘要的准确性与跨语言能力。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 79%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08249 2026-03-10 eess.AS cs.CL eess.IV 62%

Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Data

在零音频视频资源场景中利用合成视觉数据进行音频视觉语音识别的提升

Pol Buitrago, Pol Gàlvez, Oriol Pareras, Javier Hernando

机构 * Barcelona Supercomputing Center (BSC), Spain(巴塞罗那超级计算中心(BSC)) Universitat Politècnica de Catalunya (UPC), Spain(巴塞罗那理工大学(UPC))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出了一种在缺乏真实音频视频资源的情况下,通过合成视觉数据提升音频视觉语音识别性能的方法,实现了在资源匮乏语言上的高效识别。

Comments 6 pages, 3 figures, Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 62%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22321 2026-03-10 cs.SD cs.AI eess.AS 62%

SUBARU: A Practical Approach to Power Saving in Hearables Using SUB-Nyquist Audio Resolution Upsampling

SUBARU:一种用于助听器的实用节能方法,利用SUB-Nyquist音频分辨率上采样

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Benjamin Baja-Ricketts, David C Vergano, Anomadarshi Barua

机构 * George Mason University(乔治·马歇尔大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 SUBARU通过子奈奎斯特采样和低位分辨率ADC实现助听器的节能,降低功耗3.31倍,并在移动平台上实现高效的语音增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08312 2026-03-10 cs.CL 57%

Learning Multiple Utterance-Level Attribute Representations with a Unified Speech Encoder

学习多语句层面的属性表示:统一的语音编码器

Maryem Bouziane, Salima Mdhaffar, Yannick Estève

机构 * LIA - Avignon Université, France(阿维尼翁大学LIA中心,法国)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出统一的后训练框架,使语音基础模型能生成多种语句层面的表示,用于多语言语音检索和说话人识别。

Comments Submitted to Interspeech

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07966 2026-03-10 cs.CV 57%

Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time

用眼睛倾听:跨时空的自体视觉共指基准测试

Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang

机构 * Beijing Jiaotong University(北京交通大学) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) Tencent Robotics X(腾讯机器人X) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21060 2026-03-10 eess.AS 57%

Measuring Audio's Impact on Correctness: Audio-Contribution-Aware Post-Training of Large Audio Language Models

测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练

Haolin He, Xingjian Du, Renhe Sun, Zheqi Dai, Yujia Xiao, Mingru Yang, Jiayi Zhou, Xiquan Li, Zhengxi Liu, Zining Liang, Chunyat Wu, Qianhua He, Tan Lee, Xie Chen, Wei-Long Zheng, Weiqiang Wang, Mark Plumbley, Jian Liu, Qiuqiang Kong

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06854 2026-03-10 cs.SD cs.AI 57%

Are Audio-Language Models Listening? Audio-Specialist Heads for Adaptive Audio Steering

音频-语言模型在倾听吗?音频专家头用于自适应音频引导

Neta Glazer, Lenny Aharon, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) Columbia University(哥伦比亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过识别音频专家注意力头,提出一种方法来增强音频信息在音频-语言模型中的作用,从而提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08571 2026-03-10 cs.HC cs.IR cs.SD 50%

LoopLens: Supporting Search as Creation in Loop-Based Music Composition

LoopLens:在基于循环的音乐创作中支持搜索作为创作

Sheng Long, Atsuya Kobayashi, Kei Tateno

机构 * Northwestern University(西北大学) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 LoopLens通过可视化音频搜索结果,支持在基于循环的音乐创作中进行创意搜索与拼接,揭示了不同专业背景用户在探索与利用之间的行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏