arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2503.00427 2025-03-04 cs.SD cs.AI eess.AS 84%

Language Model Mapping in Multimodal Music Learning: A Grand Challenge Proposal

Daniel Chin, Gus Xia

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14585 2025-02-18 cs.CV cs.SD eess.AS 84%

Global-Local Distillation Network-Based Audio-Visual Speaker Tracking with Incomplete Modalities

Yidi Li, Yihan Li, Yixin Guo, Bin Ren, Zhenhuan Xu, Hao Guo, Hong Liu, Nicu Sebe

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS

Comments We request to withdraw our paper from arXiv due to unresolved author disagreements about the data interpretation and study conclusions. To maintain scientific integrity, we believe withdrawing the paper is necessary. We regret any confusion caused

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02266 2025-02-12 cs.SD cs.LG cs.MM eess.AS 84%

LSTMSE-Net: Long Short Term Speech Enhancement Network for Audio-visual Speech Enhancement

Arnav Jain, Jasmer Singh Sanjotra, Harshvardhan Choudhary, Krish Agrawal, Rupal Shah, Rohan Jha, M. Sajid, Amir Hussain, M. Tanveer

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.MM、eess.AS

Journal ref INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02135 2025-01-07 cs.CV cs.AI 84%

AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs

Sanjoy Chowdhury, Sayan Nag, Subhrajyoti Dasgupta, Yaoting Wang, Mohamed Elhoseiny, Ruohan Gao, Dinesh Manocha

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17292 2024-12-24 cs.CV cs.AI cs.HC 84%

AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues

Se Jin Park, Yeonju Kim, Hyeongseop Rha, Bella Godiva, Yong Man Ro

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02801 2024-11-26 cs.SD cs.AI eess.AS 84%

Mozart's Touch: A Lightweight Multi-modal Music Generation Framework Based on Pre-Trained Large Models

Jiajun Li, Tianze Xu, Xuesong Chen, Xinrui Yao, Shuchang Liu

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

Comments 10 pages, 2 figures, submitted to AIGC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.12756 2024-11-01 cs.CV cs.MM 84%

Talking Head Generation Driven by Speech-Related Facial Action Units and Audio- Based on Multimodal Representation Fusion

Sen Chen, Zhilei Liu, Jiaxing Liu, Longbiao Wang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments arXiv admin note: text overlap with arXiv:2110.09951

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22350 2024-10-31 cs.MM cs.SD eess.AS 84%

Quality-Aware End-to-End Audio-Visual Neural Speaker Diarization

Mao-Kui He, Jun Du, Shu-Tong Niu, Qing-Feng Liu, Chin-Hui Lee

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05361 2024-10-10 cs.LG cs.AI cs.SD eess.AS 84%

RespLLM: Unifying Audio and Text with Multimodal LLMs for Generalized Respiratory Health Prediction

Yuwei Zhang, Tong Xia, Aaqib Saeed, Cecilia Mascolo

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03275 2024-09-10 cs.SD cs.LG cs.MM eess.AS 84%

Multimodal Speech Enhancement Using Burst Propagation

Mohsin Raza, Leandro A. Passos, Ahmed Khubaib, Ahsan Adeel

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15803 2024-08-29 eess.AS cs.AI cs.SD 84%

ModalityMirror: Improving Audio Classification in Modality Heterogeneity Federated Learning with Multimodal Distillation

Tiantian Feng, Tuo Zhang, Salman Avestimehr, Shrikanth S. Narayanan

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12102 2024-08-23 cs.LG cs.CV cs.SD eess.AS 84%

Integrating Audio, Visual, and Semantic Information for Enhanced Multimodal Speaker Diarization

Luyao Cheng, Hui Wang, Siqi Zheng, Yafeng Chen, Rongjie Huang, Qinglin Zhang, Qian Chen, Xihao Li

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02970 2024-08-15 cs.CV cs.MM 84%

Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation

Yuanhong Chen, Yuyuan Liu, Hu Wang, Fengbei Liu, Chong Wang, Helen Frazer, Gustavo Carneiro

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments Code is available at https://github.com/cyh-0/CAVP

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00403 2024-07-30 cs.LG cs.CV cs.MM 84%

Overcome Modal Bias in Multi-modal Federated Learning via Balanced Modality Selection

Yunfeng Fan, Wenchao Xu, Haozhao Wang, Fushuo Huo, Jinyu Chen, Song Guo

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM

Comments Accepted by ECCV24, 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07575 2024-07-26 cs.CL cs.LG cs.SD eess.AS 84%

Cascaded Cross-Modal Transformer for Audio-Textual Classification

Nicolae-Catalin Ristea, Andrei Anghel, Radu Tudor Ionescu

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted for publication in Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10957 2024-07-16 cs.CV cs.AI 84%

Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes

Yaoting Wang, Peiwen Sun, Dongzhan Zhou, Guangyao Li, Honggang Zhang, Di Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14779 2024-07-09 cs.CV cs.HC cs.SD eess.AS 84%

A Joint Cross-Attention Model for Audio-Visual Fusion in Dimensional Emotion Recognition

R. Gnana Praveen, Wheidima Carneiro de Melo, Nasib Ullah, Haseeb Aslam, Osama Zeeshan, Théo Denorme, Marco Pedersoli, Alessandro Koerich, Simon Bacon, Patrick Cardinal, Eric Granger

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments arXiv admin note: text overlap with arXiv:2111.05222

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05222 2024-07-09 cs.CV cs.SD eess.AS eess.IV 84%

Cross Attentional Audio-Visual Fusion for Dimensional Emotion Recognition

R. Gnana Praveen, Eric Granger, Patrick Cardinal

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments Accepted in FG2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17614 2024-06-26 cs.CV cs.MM 84%

MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization

Adriana Fernandez-Lopez, Honglie Chen, Pingchuan Ma, Lu Yin, Qiao Xiao, Stavros Petridis, Shiwei Liu, Maja Pantic

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM

Comments Accepted at Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06582 2024-06-26 cs.CL cs.LG eess.AS 84%

Discrete Multimodal Transformers with a Pretrained Large Language Model for Mixed-Supervision Speech Processing

Viet Anh Trinh, Rosy Southwell, Yiwen Guan, Xinlu He, Zhiyong Wang, Jacob Whitehill

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07753 2024-06-13 cs.AI cs.CL 84%

The MuSe 2024 Multimodal Sentiment Analysis Challenge: Social Perception and Humor Recognition

Shahin Amiriparian, Lukas Christ, Alexander Kathan, Maurice Gerczuk, Niklas Müller, Steffen Klug, Lukas Stappen, Andreas König, Erik Cambria, Björn Schuller, Simone Eulitz

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07198 2024-06-12 eess.AS cs.MM 84%

Target Speech Diarization with Multimodal Prompts

Yidi Jiang, Ruijie Tao, Zhengyang Chen, Yanmin Qian, Haizhou Li

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.MM、eess.AS

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04615 2024-06-10 eess.AS cs.CL cs.SD 84%

What do MLLMs hear? Examining reasoning with text and sound components in Multimodal Large Language Models

Enis Berk Çoban, Michael I. Mandel, Johanna Devaney

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、eess.AS

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19171 2024-05-01 cs.CV cs.AI 84%

Explicit Correlation Learning for Generalizable Cross-Modal Deepfake Detection

Cai Yu, Shan Jia, Xiaomeng Fu, Jin Liu, Jiahe Tian, Jiao Dai, Xi Wang, Siwei Lyu, Jizhong Han

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.AI

Comments accepted by ICME 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16305 2024-04-29 cs.MM cs.SD eess.AS 84%

Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model

Gehui Chen, Guan'an Wang, Xiaowen Huang, Jitao Sang

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14952 2024-04-24 cs.CV cs.AI 84%

Leveraging Speech for Gesture Detection in Multimodal Communication

Esam Ghaleb, Ilya Burenko, Marlou Rasenberg, Wim Pouw, Ivan Toni, Peter Uhrig, Anna Wilson, Judith Holler, Aslı Özyürek, Raquel Fernández

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05583 2024-03-12 cs.HC cs.AI cs.SD eess.AS 84%

A Cross-Modal Approach to Silent Speech with LLM-Enhanced Recognition

Tyler Benster, Guy Wilson, Reshef Elisha, Francis R Willett, Shaul Druckmann

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02562 2024-03-08 cs.CV cs.CL cs.LG 84%

Evaluation of Audio-Visual Alignments in Visually Grounded Speech Models

Khazar Khorrami, Okko Räsänen

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

Comments To be published in Proc. Interspeech-2021, Brno, Czech Republic

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03582 2024-02-21 cs.SD cs.LG cs.MM eess.AS 84%

A multimodal dynamical variational autoencoder for audiovisual speech representation learning

Samir Sadok, Simon Leglaive, Laurent Girin, Xavier Alameda-Pineda, Renaud Séguier

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

Comments 14 figures, https://samsad35.github.io/site-mdvae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17604 2024-02-09 cs.CV cs.SD eess.AS 84%

Computation and Parameter Efficient Multi-Modal Fusion Transformer for Cued Speech Recognition

Lei Liu, Li Liu, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

Comments Accepted by TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏