arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4559 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4559 篇

2601.19130 2026-01-28 eess.AS 79%

Beyond Lips: Integrating Gesture and Lip Cues for Robust Audio-visual Speaker Extraction

超越嘴唇:整合手势和嘴唇线索以实现鲁棒的音频视觉说话人提取

Zexu Pan, Xinyuan Qian, Shengkui Zhao, Kun Zhou, Bin Ma

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出SeLG模型,通过融合嘴唇和手势信息,利用交叉注意力和对比学习提升音频视觉说话人提取的鲁棒性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22263 2026-01-28 eess.AS 79%

Empowering Multimodal Respiratory Sound Classification with Counterfactual Adversarial Debiasing for Out-of-Distribution Robustness

通过反事实对抗去偏来增强多模态呼吸声分类以实现分布外鲁棒性

Heejoon Koo, Miika Toikkanen, Yoon Tae Kim, Soo Yong Kim, June-Woo Kim

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出反事实对抗去偏框架,通过抑制元数据依赖和增强元数据不变表示,提升多模态呼吸声分类在分布外鲁棒性上的性能。

Comments Accepted by ICASSP 2026 (2026 IEEE International Conference on Acoustics, Speech, and Signal Processing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17880 2026-01-27 cs.CV 79%

Quran-MD: A Fine-Grained Multilingual Multimodal Dataset of the Quran

Quran-MD: 一部涵盖多语言多模态的《古兰经》细粒度数据集

Muhammad Umar Salman, Mohammad Areeb Qazi, Mohammed Talha Alam

机构 * MBZUAI(穆扎伊人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Quran-MD 是一个包含多语言多模态的《古兰经》数据集,涵盖文本、语言和音频层面,用于提升语音识别、语义检索和个性化教学系统等应用。

Comments 6 pages, 2 tables and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12354 2026-01-21 eess.AS cs.LG cs.SD 79%

Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models

骨传导引导的多模态语音增强与条件扩散模型

Sina Khanagha, Bunlong Lay, Timo Gerkmann

机构 * Signal Processing Group, University of Hamburg, Germany(汉堡大学信号处理组)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一种基于条件扩散模型的多模态语音增强框架,通过整合骨传导传感器与空气传导麦克风,有效提升极端噪声环境下的语音增强性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11590 2026-01-21 cs.DC cs.AI 79%

EPD-Serve: A Flexible Multimodal EPD Disaggregation Inference Serving System On Ascend

EPD-Serve: 一种灵活的多模态EPD解耦推理服务系统在Ascend上

Fan Bai, Pai Peng, Zhengzhi Tang, Zhe Wang, Gong Chen, Xiang Lu, Yinuo Li, Huan Lin, Weizhe Lin, Yaoyuan Wang, Xiaosong Li

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 EPD-Serve通过阶段级解耦和异构硬件协同,提升多模态模型推理系统的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05699 2026-01-15 cs.CL 79%

Afri-MCQA: Multimodal Cultural Question Answering for African Languages

Afri-MCQA:面向非洲语言的多模态文化问答

Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio

机构 * MBZUAI AI4Bharat Indian Institute of Technology, Madras(印度理工学院马德拉斯分校) Saarland University(萨尔兰大学) Aston University(阿斯顿大学) Addis Ababa University(亚的斯亚贝巴大学) Lesan AI Friedrich-Alexander University(弗里德里希-亚历山大大学) University of Pretoria(比勒陀利亚大学) University of Minneosta -Twin Cities(明尼苏达大学-双城分校) Lelapa AI Tshwane University of Technology(茨瓦内技术大学) Digital Umuganda University of Botswana(博茨瓦纳大学) Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Afri-MCQA是首个针对非洲语言的多模态文化问答基准,揭示了本地语言在语音和文本任务中与英语的显著性能差距,强调了文化扎根预训练和跨语言文化转移的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06372 2026-01-06 cs.SD cs.AI 79%

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 79%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19687 2025-12-23 cs.SD cs.CV cs.LG 79%

Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning

推动音频视觉感知前沿:大规模多模态对应学习

Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matt Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 PE-AV通过大规模多模态对应学习提升音频视频理解,支持跨模态嵌入并实现语音检索等新任务,同时开发PE-A-Frame实现细粒度音频-文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14491 2025-12-19 cs.LG cs.MM 79%

Multimodal Methods for Analyzing Learning and Training Environments: A Systematic Literature Review

多模态方法用于分析学习与训练环境:系统文献综述

Clayton Cohn, Eduardo Davalos, Caleb Vatral, Joyce Horn Fonteles, Hanchen David Wang, Austin Coursey, Surya Rayala, Ashwin T S, Meiyi Ma, Gautam Biswas

机构 * Vanderbilt University(范德比大学) Tennessee State University(田纳西州立大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文综述了多模态方法在学习与训练环境中的应用,提出分类法和框架,揭示了多模态整合对行为分析的价值及现存挑战。

Comments Submitted to ACM Computing Surveys. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13495 2025-12-16 cs.CV 79%

Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation

Soul:为高保真长期多模态动画注入生命

Jiangning Zhang, Junwei Zhu, Zhenye Gan, Donghao Luo, Chuming Lin, Feifan Xu, Xu Peng, Jianlong Hu, Yuansen Liu, Yijia Hong, Weijian Cao, Han Feng, Xu Chen, Chencan Fu, Keke He, Xiaobin Hu, Chengjie Wang

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Soul通过多模态驱动框架实现高保真长期数字人类动画,结合自动化标注和优化推理效率,显著提升视频质量和唇同步精度。

Comments Project page: https://zhangzjn.github.io/projects/Soul/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02149 2025-12-11 cs.CV 79%

AURORA:Augmented Understanding via Structured Reasoning and Reinforcement Learning for Reference Audio-Visual Segmentation

AURORA:通过结构化推理和强化学习增强参考音频视频分割

Ziyang Luo, Nian Liu, Fahad Shahbaz Khan, Junwei Han

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 AURORA通过结构化推理和强化学习提升参考音频视频分割的准确性和鲁棒性

Comments AAAI2026,code:https://github.com/Sssssuperior/AURORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08953 2025-12-11 cs.HC cs.AI 79%

SimClinician: A Multimodal Simulation Testbed for Reliable Psychologist AI Collaboration in Mental Health Diagnosis

SimClinician: 一种多模态模拟测试平台,用于心理健康诊断中可靠的心理学家AI协作

Filippo Cenacchi, Longbing Cao, Deborah Richards

机构 * Macquarie University(麦考瑞大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SimClinician是一种多模态模拟平台,通过整合音频、文本和目光-表情模式,帮助心理学家在心理健康诊断中与AI协作,提升诊断的准确性和交互的流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08238 2025-12-10 cs.SD cs.AI 79%

SpeechQualityLLM: LLM-Based Multimodal Assessment of Speech Quality

SpeechQualityLLM: 基于大语言模型的多模态语音质量评估

Mahathir Monjur, Shahriar Nirjon

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 SpeechQualityLLM是一种基于大语言模型的多模态语音质量评估系统,通过生成文本答案来提供灵活的自然语言接口,减少对大规模测试的依赖。

Comments 9 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12093 2025-12-10 cs.CL 79%

SENSE models: an open source solution for multilingual and multimodal semantic-based tasks

SENSE模型:一种开源解决方案,用于多语言和多模态基于语义的任务

Salima Mdhaffar, Haroun Elleuch, Chaimae Chellaf, Ha Nguyen, Yannick Estève

机构 * LIA, Avignon Université(阿维尼昂大学LIA)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 SENSE模型通过教师-学生框架实现多语言和多模态语义任务的高效语义对齐,提供开源解决方案并取得竞争力表现。

Comments Accepted to IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06485 2025-12-09 cs.CV 79%

Sanvaad: A Multimodal Accessibility Framework for ISL Recognition and Voice-Based Interaction

Sanvaad: 一种多模态可访问性框架,用于手语识别和基于语音的交互

Kush Revankar, Shreyas Deshpande, Araham Sayeed, Ansh Tandale, Sarika Bobde

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 Sanvaad是一种多模态可访问性框架,通过结合轻量级计算机视觉和语音处理工具,为聋人和视障用户提供实时双向沟通解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06259 2025-12-09 cs.SD cs.AI cs.LG 79%

Who Will Top the Charts? Multimodal Music Popularity Prediction via Adaptive Fusion of Modality Experts and Temporal Engagement Modeling

谁会登顶排行榜?通过适应性融合模态专家和时间参与建模的多模态音乐流行度预测

Yash Choudhary, Preeti Rao, Pushpak Bhattacharyya

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 GAMENet通过融合多模态数据和时间参与建模,提升了音乐流行度预测的准确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00563 2025-12-02 cs.SD cs.AI cs.LG 79%

Explainable Multi-Modal Deep Learning for Automatic Detection of Lung Diseases from Respiratory Audio Signals

可解释的多模态深度学习用于从呼吸音频信号自动检测肺部疾病

S M Asiful Islam Saky, Md Rashidul Islam, Md Saiful Arefin, Shahaba Alam

机构 * Albukhary International University(阿尔布胡亚国际大学)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出一种可解释的多模态深度学习框架,通过结合频谱-时间编码器和手工制作的声学特征编码器,利用呼吸音频信号自动检测肺部疾病,实现了高准确率和良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11811 2025-11-26 cs.HC cs.SY eess.AS eess.IV eess.SY 79%

Lessons Learned from Developing a Privacy-Preserving Multimodal Wearable for Local Voice-and-Vision Inference

从开发一个隐私保护的多模态可穿戴设备以实现本地语音和视觉推断中获得的启示

Yonatan Tussa, Andy Heredia, Nirupam Roy

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文介绍了开发隐私保护多模态可穿戴设备的经验,展示了如何在本地进行语音和视觉推断,并探讨了在日常环境中平衡隐私、响应性和可用性的设计挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18718 2025-11-25 cs.RO cs.AI 79%

AIRHILT: A Human-in-the-Loop Testbed for Multimodal Conflict Detection in Aviation

AIRHILT:航空多模态冲突检测的人机交互测试平台

Omar Garib, Jayaprakash D. Kambhampaty, Olivia J. Pinon Fischer, Dimitri N. Mavris

机构 * Daniel Guggenheim School of Aerospace Engineering, Georgia Institute of Technology(丹尼尔·古根海姆航空航天工程学院,佐治亚理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 AIRHILT是一款用于航空多模态冲突检测的人机交互测试平台,通过集成ASR、视觉检测和决策模型,实现冲突检测的高效评估与研究。

Comments 9 pages, 4 figures, 1 table, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 79%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17955 2025-11-25 cs.CL 79%

MTikGuard System: A Transformer-Based Multimodal System for Child-Safe Content Moderation on TikTok

MTikGuard系统:一种基于Transformer的多模态系统,用于TikTok上的儿童安全内容审核

Dat Thanh Nguyen, Nguyen Hung Lam, Anh Hoang-Thi Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Faculty of Software Engineering, University of Information Technology(软件工程学院,信息科技大学) Faculty of Computer Science, University of Information Technology(计算机科学学院,信息科技大学) University of Information Technology, Ho Chi Minh City(信息科技大学,胡志明市) Vietnam National University, Ho Chi Minh City(越南国家大学,胡志明市)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 MTikGuard系统通过多模态分类框架和扩展数据集,实现TikTok儿童安全内容审核的高准确率和实时部署。

Comments Accepted at PACLIC39

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17776 2025-11-25 cs.LG cs.MM 79%

PrismSSL: One Interface, Many Modalities; A Single-Interface Library for Multimodal Self-Supervised Learning

PrismSSL: 一个接口,多种模态;一个多模态自监督学习的单一接口库

Melika Shirian, Kianoosh Vadaei, Kian Majlessi, Audrina Ebrahimi, Arshia Hemmat, Peyman Adibi, Hossein Karshenas

机构 * dept. Computer Engineering University of Isfahan(计算机工程系 哈尔拉克大学) dept. Computer Engineering University of Texas at Dallas(计算机工程系 德克萨斯大学达拉斯分校) dept. Computer Science University of Oxford(计算机科学系 奥克兰大学) dept. Artificial Intelligence University of Isfahan(人工智能系 哈尔拉克大学)

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);分类 cs.MM

AI总结 PrismSSL是一个统一多模态自监督学习的单一接口库,提供模块化代码、分布式训练和图形化仪表盘,支持多种模态和方法的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15312 2025-11-20 cs.CV 79%

A Multimodal Transformer Approach for UAV Detection and Aerial Object Recognition Using Radar, Audio, and Video Data

Mauro Larrat, Claudomiro Sales

机构 * Institute of Exact and Natural Sciences(精确与自然科学研究所) Federal University of Pará(巴西亚马逊联邦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments 23 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05817 2025-11-19 cs.HC cs.MM cs.SD 79%

TalkSketch: Multimodal Generative AI for Real-time Sketch Ideation with Speech

Weiyan Shi, Sunaya Upadhyay, Geraldine Quek, Kenny Tsu Wei Choo

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments Accepted at AAAI 2026 Workshop on Creative AI for Live Interactive Performances (CLIP). To be published in Springer CCIS series

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11930 2025-11-18 cs.HC cs.CV cs.LG cs.SD 79%

Enhancing XR Auditory Realism via Multimodal Scene-Aware Acoustic Rendering

Tianyu Xu, Jihan Li, Penghe Zu, Pranav Sahay, Maruchi Kim, Jack Obeng-Marnu, Farley Miller, Xun Qian, Katrina Passarella, Mahitha Rachumalla, Rajeev Nongpiur, D. Shin

机构 * Google(谷歌)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Journal ref Proceedings of the 38th Annual ACM Symposium on User Interface Software and Technology (UIST '25), Article 17, 1-16, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10325 2025-11-14 cs.MM 79%

TMDC: A Two-Stage Modality Denoising and Complementation Framework for Multimodal Sentiment Analysis with Missing and Noisy Modalities

Yan Zhuang, Minhao Liu, Yanru Zhang, Jiawen Deng, Fuji Ren

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05735 2025-11-14 cs.AI 79%

A Comprehensive Survey on Multi-modal Conversational Emotion Recognition with Deep Learning

Yuntao Shou, Tao Meng, Wei Ai, Fangze Fu, Nan Yin, Keqin Li

机构 * Central South University of Forestry and Technology(中部林业科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) State University of New York(纽约州立大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

Comments 36 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09448 2025-11-13 cs.MM cs.LG 79%

MCAD: Multimodal Context-Aware Audio Description Generation For Soccer

Lipisha Chaudhary, Trisha Mittal, Subhadra Gopalakrishnan, Ifeoma Nwogu, Jaclyn Pytlarz

机构 * University at Buffalo, SUNY(布法罗大学,SUNY) Dolby Laboratories Inc.(杜比实验室公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22229 2025-11-13 cs.SD eess.AS 79%

Two-stage Audio-Visual Target Speaker Extraction System for Real-Time Processing On Edge Device

Zixuan Li, Xueliang Zhang, Lei Miao, Zhipeng Yan, Ying Sun, Chong Zhu

机构 * College of Computer Science, Inner Mongolia University, China(内蒙古大学计算机科学学院) Lenovo, China(联想公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏