arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4546 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4546 篇

2410.16438 2024-10-23 cs.SD cs.CV cs.MM eess.AS 89%

AlignVSR: Audio-Visual Cross-Modal Alignment for Visual Speech Recognition

Zehua Liu, Xiaolou Li, Chen Chen, Li Guo, Lantian Li, Dong Wang

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12725 2024-05-07 cs.SD cs.CV cs.LG cs.MM eess.AS 89%

Separate in the Speech Chain: Cross-Modal Conditional Audio-Visual Target Speech Extraction

Zhaoxi Mu, Xinyu Yang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08488 2024-03-12 cs.CL cs.AI cs.SD eess.AS 89%

Improving Audio-Visual Speech Recognition by Lip-Subword Correlation Based Visual Pre-training and Cross-Modal Fusion Encoder

Yusheng Dai, Hang Chen, Jun Du, Xiaofei Ding, Ning Ding, Feijun Jiang, Chin-Hui Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments 6 pages, 2 figures, published in ICME2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01197 2022-07-05 cs.SD cs.CV cs.MM eess.AS 89%

Multi-Modal Multi-Correlation Learning for Audio-Visual Speech Separation

Xiaoyu Wang, Xiangyu Kong, Xiulian Peng, Yan Lu

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments 5 pages, accepted by interspeech2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.02971 2021-04-08 cs.CV cs.AI cs.MM 89%

MPN: Multimodal Parallel Network for Audio-Visual Event Localization

Jiashuo Yu, Ying Cheng, Rui Feng

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments IEEE International Conference on Multimedia and Expo (ICME) 2021 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.08732 2019-10-22 cs.CV cs.MM cs.SD eess.AS 89%

Coordinated Joint Multimodal Embeddings for Generalized Audio-Visual Zeroshot Classification and Retrieval of Videos

Kranti Kumar Parida, Neeraj Matiyali, Tanaya Guha, Gaurav Sharma

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments To appear in WACV 2020, Project Page: https://cse.iitk.ac.in/users/kranti/avzsl.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 88%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);omni-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05713 2026-06-05 cs.MM cs.SD eess.AS 88%

Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

超越生成式解码:来自原生全模态大语言模型的判别性隐藏状态读出用于多模态情感分析

Bin Wen, Tien-Ping Tan

机构 * School of Computer Sciences, Universiti Sains Malaysia, Penang, Malaysia(计算机科学学院,马来西亚国际科学大学,槟城)

专题命中 音频语音多模态 :multimodal(title,abstract);omni-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 针对多模态情感分析中生成式读出将连续回归绑定到离散自回归解码导致精度和效率损失的问题,提出基于原生全模态大语言模型Qwen2.5-Omni-7B的Thinker模块的判别性读出方法,通过轻量回归头直接映射最终层隐藏状态,在单消费级GPU上实现最先进性能。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 88%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08581 2026-03-20 cs.SD cs.AI eess.AS 88%

Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions

通过多样声学条件下的语音查询评估音频-视觉多模态大语言模型的幻觉

Hansol Park, Hoseong Ahn, Junwon Moon, Yejin Lee, Kyuhong Shim

机构 * Department of Intelligent Software, Sungkyunkwan University(智能软件系,成均馆大学) Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,成均馆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);image-text(abstract);分类 cs.AI、eess.AS

AI总结 研究探讨语音查询对多模态幻觉的影响,通过RePOPE-Spk基准测试发现语音查询导致错误率显著增加,提出改进方法以提升语音界面可靠性。

Comments Submitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12796 2026-02-24 cs.MM cs.SD eess.AS 88%

A Survey on Cross-Modal Interaction Between Music and Multimodal Data

多模态数据与音乐交叉交互的综述

Sifei Li, Mining Tan, Feier Shen, Minyan Luo, Zijiao Yin, Fan Tang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, Beijing, 100190, China. E-mail: S. Li School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, 100190, China. E-mail: F. Shen Institute of Computing Technology, Chinese Academy of Sciences, Beijing, 100190, China. E-mail: .

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 本文综述了音乐与多模态数据的交叉交互,探讨了音乐在多模态学习中的作用,并提出了未来研究的方向。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16025 2025-09-22 cs.CL cs.AI 88%

Session-Level Spoken Language Assessment with a Multimodal Foundation Model via Multi-Target Learning

Hong-Yun Lin, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * Department of Computer Science(计算机科学系) Information Engineering, National Taiwan Normal University(信息工程,台湾正常大学)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CL、cs.AI

Comments Copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14097 2025-09-18 cs.CV cs.MM 88%

Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing

Yaru Chen, Ruohao Guo, Liting Gao, Yang Xiang, Qingyu Luo, Zhenbo Li, Wenwu Wang

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12842 2025-08-19 cs.CV cs.MM 88%

Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection

Ronghao Lin, Sijie Mai, Ying Zeng, Qiaolin He, Aolin Xiong, Haifeng Hu

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学) South China Normal University(华南师范大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM

Comments Accepted at ACM MM 2025 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04623 2025-06-20 cs.CV eess.AS 88%

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11521 2025-06-16 cs.CR cs.AI cs.MM 88%

Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models

Jinming Wen, Xinyi Wu, Shuai Zhao, Yanhao Jia, Yuwen Li

机构 * Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07358 2025-06-10 cs.SD cs.AI cs.LG eess.AS 88%

Lightweight Joint Audio-Visual Deepfake Detection via Single-Stream Multi-Modal Learning Framework

Kuiyuan Zhang, Wenjie Pei, Rushi Lan, Yifang Guo, Zhongyun Hua

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03364 2025-06-05 eess.AS cs.MM cs.SD 88%

Towards Source Attribution of Singing Voice Deepfake with Multimodal Foundation Models

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Swarup Ranjan Behera, Priyabrata Mallick, Pailla Balakrishna Reddy, Arun Balaji Buduru, Rajesh Sharma

机构 * IIIT-DelhiIndia(印度IIIT-Delhi) UPESIndia(印度UPES) V.B.S.P.UIndia(印度V.B.S.P.U) Independent ResearcherIndia(印度独立研究者) Reliance AIIndia(印度Reliance AI) University of TartuEstonia(爱沙尼亚塔尔图大学) Plaksha UniversityIndia(印度Plaksha大学)

专题命中 音频语音多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.MM、eess.AS

Comments Accepted to INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13971 2025-05-28 cs.SD cs.AI eess.AS 88%

The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition

Ming Gao, Shilong Wu, Hang Chen, Jun Du, Chin-Hui Lee, Shinji Watanabe, Jingdong Chen, Siniscalchi Sabato Marco, Odette Scharenborg

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) Northwestern Polytechnical University(西北工业大学) University of Palermo(巴勒莫大学) Delft University of Technology(代尔夫特理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);multi-modal(abstract);分类 cs.AI、eess.AS

Comments Accepted by Interspeech 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11248 2024-12-18 cs.CV cs.MM 88%

Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing

Pengcheng Zhao, Jinxing Zhou, Yang Zhao, Dan Guo, Yanxiang Chen

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by AAAI-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03563 2024-10-15 eess.AS cs.CL cs.LG eess.IV 88%

Learning Video Temporal Dynamics with Cross-Modal Attention for Robust Audio-Visual Speech Recognition

Sungnyun Kim, Kangwook Jang, Sangmin Bae, Hoirin Kim, Se-Young Yun

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments Accepted at SLT 2024 Main Conference; Code is available at https://github.com/sungnyun/avsr-temporal-dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15136 2024-04-22 eess.SP cs.MM cs.SD eess.AS eess.IV 88%

A multi-modal approach for identifying schizophrenia using cross-modal attention

Gowtham Premananth, Yashish M. Siriwardena, Philip Resnik, Carol Espy-Wilson

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(title,abstract);分类 cs.MM、eess.AS

Comments Accepted to Annual International Conference of the IEEE Engineering in Medicine and Biology Society 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15563 2024-03-19 cs.CV cs.IR cs.SD eess.AS 88%

Multimodal Transformer Distillation for Audio-Visual Synchronization

Xuanjun Chen, Haibin Wu, Chung-Che Wang, Hung-yi Lee, Jyh-Shing Roger Jang

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12264 2024-02-22 eess.AS cs.MM cs.SD eess.IV 88%

CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing

Xianghu Yue, Xiaohai Tian, Lu Lu, Malu Zhang, Zhizheng Wu, Haizhou Li

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12826 2023-11-23 cs.CV cs.AI 88%

LiveChat: Video Comment Generation from Audio-Visual Multimodal Contexts

Julien Lalanne, Raphael Bournet, Yi Yu

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07517 2023-10-12 cs.CV cs.MM 88%

CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing

Yaru Chen, Ruohao Guo, Xubo Liu, Peipei Wu, Guangyao Li, Zhenbo Li, Wenwu Wang

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM

Comments 5 pages, 3 figures, 15 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05338 2023-03-14 cs.SD cs.MM eess.AS 88%

MMCosine: Multi-Modal Cosine Loss Towards Balanced Audio-Visual Fine-Grained Learning

Ruize Xu, Ruoxuan Feng, Shi-Xiong Zhang, Di Hu

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11254 2023-02-23 cs.SD cs.CV cs.LG eess.AS eess.IV 88%

Cross-modal Audio-visual Co-learning for Text-independent Speaker Verification

Meng Liu, Kong Aik Lee, Longbiao Wang, Hanyi Zhang, Chang Zeng, Jianwu Dang

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00539 2022-12-02 cs.MM cs.CV 88%

Audio-Visual Activity Guided Cross-Modal Identity Association for Active Speaker Detection

Rahul Sharma, Shrikanth Narayanan

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.CV、cs.MM

Comments Under review at OJSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03434 2022-11-08 cs.MM cs.AI 88%

Complete Cross-triplet Loss in Label Space for Audio-visual Cross-modal Retrieval

Donghuo Zeng, Yanan Wang, Jianming Wu, Kazushi Ikeda

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);分类 cs.AI、cs.MM

Comments 9 pages, 5 figures, 3 tables, accepted by IEEE ISM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏