arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2406.01321 2024-06-04 cs.SD cs.AI cs.LG cs.MM eess.AS 82%

Sequence-to-Sequence Multi-Modal Speech In-Painting

Mahsa Kadkhodaei Elyaderani, Shahram Shirani

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00901 2024-06-04 cs.MM cs.AI cs.LG cs.SD eess.AS 82%

Robust Multi-Modal Speech In-Painting: A Sequence-to-Sequence Approach

Mahsa Kadkhodaei Elyaderani, Shahram Shirani

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13260 2024-05-29 cs.CL cs.MM cs.SD eess.AS 82%

MF-AED-AEC: Speech Emotion Recognition by Leveraging Multimodal Fusion, Asr Error Detection, and Asr Error Correction

Jiajun He, Xiaohan Shi, Xingfeng Li, Tomoki Toda

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Accepted by ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07336 2024-04-12 cs.CV cs.MM eess.AS 82%

PEAVS: Perceptual Evaluation of Audio-Visual Synchrony Grounded in Viewers' Opinion Scores

Lucas Goncalves, Prashant Mathur, Chandrashekhar Lavania, Metehan Cekic, Marcello Federico, Kyu J. Han

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00511 2024-04-12 cs.CL cs.CV cs.MM 82%

MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models

Zebang Cheng, Fuqiang Niu, Yuxiang Lin, Zhi-Qi Cheng, Bowen Zhang, Xiaojiang Peng

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

Comments Ranked 3rd in SemEval '24 Task 3 with F1 of 0.3435, close to 1st & 2nd by 0.0339 & 0.0025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06462 2024-04-09 cs.CV cs.AI cs.SD eess.AS 82%

Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation

Qi Yang, Xing Nie, Tong Li, Pengfei Gao, Ying Guo, Cheng Zhen, Pengfei Yan, Shiming Xiang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

Comments CVPR 2024 Highlight. 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05698 2024-04-02 cs.CV cs.HC cs.MM cs.SD eess.AS 82%

HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition

Licai Sun, Zheng Lian, Bin Liu, Jianhua Tao

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by Information Fusion. The code is available at https://github.com/sunlicai/HiCMAE

Journal ref Information Fusion, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18821 2024-03-28 cs.SD cs.CV cs.MM eess.AS 82%

Real Acoustic Fields: An Audio-Visual Room Acoustics Dataset and Benchmark

Ziyang Chen, Israel D. Gebru, Christian Richardt, Anurag Kumar, William Laney, Andrew Owens, Alexander Richard

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to CVPR 2024. Project site: https://facebookresearch.github.io/real-acoustic-fields/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10787 2024-03-20 eess.AS cs.CV cs.MM cs.SD 82%

AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models

Yuan Tseng, Layne Berry, Yi-Ting Chen, I-Hsiang Chiu, Hsuan-Hao Lin, Max Liu, Puyuan Peng, Yi-Jen Shih, Hung-Yu Wang, Haibin Wu, Po-Yao Huang, Chun-Mao Lai, Shang-Wen Li, David Harwath, Yu Tsao, Shinji Watanabe, Abdelrahman Mohamed, Chi-Luen Feng, Hung-yi Lee

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ICASSP 2024; Evaluation Code: https://github.com/roger-tseng/av-superb Submission Platform: https://av.superbbenchmark.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03145 2024-03-06 cs.CV cs.LG cs.MM cs.SD eess.AS 82%

Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization

Yuxin Guo, Shijie Ma, Hu Su, Zhiqing Wang, Yuhao Zhao, Wei Zou, Siyang Sun, Yun Zheng

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to NeurIPS2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03095 2024-03-06 cs.CV cs.MM cs.SD eess.AS 82%

Cross Pseudo-Labeling for Semi-Supervised Audio-Visual Source Localization

Yuxin Guo, Shijie Ma, Yuhao Zhao, Hu Su, Wei Zou

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted To ICASSP2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06984 2024-02-13 cs.SD cs.CV cs.MM eess.AS eess.IV 82%

Speech motion anomaly detection via cross-modal translation of 4D motion fields from tagged MRI

Xiaofeng Liu, Fangxu Xing, Jiachen Zhuo, Maureen Stone, Jerry L. Prince, Georges El Fakhri, Jonghye Woo

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments SPIE Medical Imaging 2024: Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12793 2024-02-06 eess.AS cs.CL cs.MM cs.SD 82%

Zero-Shot End-to-End Spoken Language Understanding via Cross-Modal Selective Self-Training

Jianfeng He, Julian Salazar, Kaisheng Yao, Haoqi Li, Jinglun Cai

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.MM、eess.AS

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07929 2024-02-05 cs.CV cs.LG cs.MM cs.SD eess.AS 82%

Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer

Yaoting Wang, Weisong Liu, Guangyao Li, Jian Ding, Di Hu, Xi Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06419 2024-01-23 eess.AS cs.AI cs.CL 82%

AV-data2vec: Self-supervised Learning of Audio-Visual Speech Representations with Contextualized Target Representations

Jiachen Lian, Alexei Baevski, Wei-Ning Hsu, Michael Auli

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments 2023 ASRU

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04047 2023-12-29 cs.CV cs.AI cs.CL cs.LG 82%

CAVEN: An Embodied Conversational Agent for Efficient Audio-Visual Navigation in Noisy Environments

Xiulong Liu, Sudipta Paul, Moitreya Chatterjee, Anoop Cherian

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15197 2023-12-27 cs.SD cs.CL cs.CV eess.AS 82%

TransFace: Unit-Based Audio-Visual Speech Synthesizer for Talking Head Translation

Xize Cheng, Rongjie Huang, Linjun Li, Tao Jin, Zehan Wang, Aoxiong Yin, Minglei Li, Xinyu Duan, changpeng yang, Zhou Zhao

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07223 2023-12-27 cs.SD cs.CV cs.MM eess.AS 82%

Transavs: End-To-End Audio-Visual Segmentation With Transformer

Yuhang Ling, Yuxi Li, Zhenye Gan, Jiangning Zhang, Mingmin Chi, Yabiao Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09126 2023-11-15 cs.SD cs.CV cs.MM eess.AS eess.IV 82%

STARSS23: An Audio-Visual Dataset of Spatial Recordings of Real Scenes with Spatiotemporal Annotations of Sound Events

Kazuki Shimada, Archontis Politis, Parthasaarathy Sudarsanam, Daniel Krause, Kengo Uchida, Sharath Adavanne, Aapo Hakala, Yuichiro Koyama, Naoya Takahashi, Shusuke Takahashi, Tuomas Virtanen, Yuki Mitsufuji

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments 27 pages, 9 figures, accepted for publication in NeurIPS 2023 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13507 2023-10-27 cs.CL cs.AI cs.CV 82%

Multimodal Automated Fact-Checking: A Survey

Mubashara Akhtar, Michael Schlichtkrull, Zhijiang Guo, Oana Cocarascu, Elena Simperl, Andreas Vlachos

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments The 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP): Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11019 2023-10-10 cs.CV cs.AI cs.MM 82%

Annotation-free Audio-Visual Segmentation

Jinxiang Liu, Yu Wang, Chen Ju, Chaofan Ma, Ya Zhang, Weidi Xie

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments Camera-ready version for WACV 2024; project page is https://jinxiang-liu.github.io/anno-free-AVS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14320 2023-09-26 cs.RO 82%

MUTEX: Learning Unified Policies from Multimodal Task Specifications

Rutav Shah, Roberto Martín-Martín, Yuke Zhu

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

Comments Accepted at 7th Conference on Robot Learning (CoRL 2023), Atlanta, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13942 2023-09-26 cs.CV cs.MM cs.SD eess.AS 82%

Speed Co-Augmentation for Unsupervised Audio-Visual Pre-training

Jiangliu Wang, Jianbo Jiao, Yibing Song, Stephen James, Zhan Tong, Chongjian Ge, Pieter Abbeel, Yun-hui Liu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Published at the CVPR 2023 Sight and Sound workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.16342 2023-09-26 cs.CV cs.AI cs.CL 82%

Language-Guided Audio-Visual Source Separation via Trimodal Consistency

Reuben Tan, Arijit Ray, Andrea Burns, Bryan A. Plummer, Justin Salamon, Oriol Nieto, Bryan Russell, Kate Saenko

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07925 2023-09-18 eess.AS cs.AI cs.MM cs.SD 82%

Hierarchical Audio-Visual Information Fusion with Multi-label Joint Decoding for MER 2023

Haotian Wang, Yuxuan Xi, Hang Chen, Jun Du, Yan Song, Qing Wang, Hengshun Zhou, Chenxi Wang, Jiefeng Ma, Pengfei Hu, Ya Jiang, Shi Cheng, Jie Zhang, Yuzhe Weng

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

Comments 5 pages, 4 figures

Journal ref The 31st ACM International Conference on Multimedia (MM'23), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06087 2023-08-21 cs.MM cs.AI cs.CV 82%

Audio-Visual Spatial Integration and Recursive Attention for Robust Sound Source Localization

Sung Jin Um, Dongjin Kim, Jung Uk Kim

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

Comments Camera-Ready, ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15167 2023-07-31 cs.HC 82%

PEANUT: A Human-AI Collaborative Tool for Annotating Audio-Visual Data

Zheng Zhang, Zheng Ning, Chenliang Xu, Yapeng Tian, Toby Jia-Jun Li

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract)

Comments 18 pages, published in UIST'23

URL PDF HTML 收藏
2305.16049 2023-07-31 cs.CV cs.MM cs.SD eess.AS 82%

CN-Celeb-AV: A Multi-Genre Audio-Visual Dataset for Person Recognition

Lantian Li, Xiaolou Li, Haoyu Jiang, Chen Chen, Ruihai Hou, Dong Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments INTERSPEECH 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10563 2023-06-21 eess.AS cs.CV cs.MM cs.SD 82%

Hearing Lips in Noise: Universal Viseme-Phoneme Mapping and Transfer for Robust Audio-Visual Speech Recognition

Yuchen Hu, Ruizhe Li, Chen Chen, Chengwei Qin, Qiushi Zhu, Eng Siong Chng

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments 19 pages, 9 figures, Accepted by ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09093 2023-06-16 cs.CL cs.AI cs.CV 82%

Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration

Chenyang Lyu, Minghao Wu, Longyue Wang, Xinting Huang, Bingshuai Liu, Zefeng Du, Shuming Shi, Zhaopeng Tu

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Longyue Wang is the corresponding author. Our project page is at https://github.com/lyuchenyang/Macaw-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏