arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2201.09165 2022-01-25 cs.MM cs.CV cs.SD eess.AS 82%

A Pre-trained Audio-Visual Transformer for Emotion Recognition

Minh Tran, Mohammad Soleymani

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by IEEE ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.07594 2021-08-31 cs.CL cs.AI eess.AS 82%

Fast End-to-End Speech Recognition via Non-Autoregressive Models and Cross-Modal Knowledge Transferring from BERT

Ye Bai, Jiangyan Yi, Jianhua Tao, Zhengkun Tian, Zhengqi Wen, Shuai Zhang

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11059 2021-06-22 cs.LG 82%

Improving Multi-Modal Learning with Uni-Modal Teachers

Chenzhuang Du, Tingle Li, Yichen Liu, Zixin Wen, Tianyu Hua, Yue Wang, Hang Zhao

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00451 2021-06-02 cs.CV cs.AI cs.CL 82%

Highlight Timestamp Detection Model for Comedy Videos via Multimodal Sentiment Analysis

Fan Huang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.11116 2021-04-23 cs.CV cs.LG cs.MM cs.SD eess.AS eess.IV 82%

Pose-Controllable Talking Face Generation by Implicitly Modularized Audio-Visual Representation

Hang Zhou, Yasheng Sun, Wayne Wu, Chen Change Loy, Xiaogang Wang, Ziwei Liu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2021. Code and models are available at https://github.com/Hangz-nju-cuhk/Talking-Face_PC-AVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.04790 2021-04-09 cs.AI cs.CL cs.CV 82%

The Hateful Memes Challenge: Detecting Hate Speech in Multimodal Memes

Douwe Kiela, Hamed Firooz, Aravind Mohan, Vedanuj Goswami, Amanpreet Singh, Pratik Ringshia, Davide Testuggine

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00239 2021-04-06 cs.CV cs.MM cs.SD eess.AS 82%

Positive Sample Propagation along the Audio-Visual Event Line

Jinxing Zhou, Liang Zheng, Yiran Zhong, Shijie Hao, Meng Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to CVPR 2021. Code is available at https://github.com/jasongief/PSP_CVPR_2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12975 2020-12-25 cs.AI cs.CL cs.CV 82%

Detecting Hate Speech in Memes Using Multimodal Deep Learning Approaches: Prize-winning solution to Hateful Memes Challenge

Riza Velioglu, Jewgeni Rose

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments Presented at NeurIPS (2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.06584 2020-12-21 cs.HC 82%

Jointly Optimizing Sensing Pipelines for Multimodal Mixed Reality Interaction

Darshana Rathnayake, Ashen de Silva, Dasun Puwakdandawa, Lakmal Meegahapola, Archan Misra, Indika Perera

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

Comments 17th IEEE International Conference on Mobile Ad-Hoc and Sensor Systems (MASS) - 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.08021 2020-10-19 cs.CL cs.CV cs.LG cs.MM 82%

MAST: Multimodal Abstractive Summarization with Trimodal Hierarchical Attention

Aman Khullar, Udit Arora

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

Comments To appear in the first EMNLP Workshop on NLP Beyond Text, 2020. Aman Khullar and Udit Arora have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.06258 2020-08-17 cs.CL cs.CV cs.SD eess.AS 82%

Unsupervised vs. transfer learning for multimodal one-shot matching of speech and images

Leanne Nortje, Herman Kamper

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

Comments Accepted at Interspeech 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.02125 2020-03-02 cs.CL cs.AI cs.LG cs.SD eess.AS stat.ML 82%

Strong and Simple Baselines for Multimodal Utterance Embeddings

Paul Pu Liang, Yao Chong Lim, Yao-Hung Hubert Tsai, Ruslan Salakhutdinov, Louis-Philippe Morency

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

Comments NAACL 2019 oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.05654 2019-12-13 cs.CV cs.AI eess.AS 82%

deepsing: Generating Sentiment-aware Visual Stories using Cross-modal Music Translation

Nikolaos Passalis, Stavros Doropoulos

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.04979 2019-12-12 eess.AS cs.CL cs.CV cs.SD eess.IV 82%

Advances in Online Audio-Visual Meeting Transcription

Takuya Yoshioka, Igor Abramovski, Cem Aksoylar, Zhuo Chen, Moshe David, Dimitrios Dimitriadis, Yifan Gong, Ilya Gurvich, Xuedong Huang, Yan Huang, Aviv Hurvitz, Li Jiang, Sharon Koubi, Eyal Krupka, Ido Leichter, Changliang Liu, Partha Parthasarathy, Alon Vinnikov, Lingfeng Wu, Xiong Xiao, Wayne Xiong, Huaming Wang, Zhenghao Wang, Jun Zhang, Yong Zhao, Tianyan Zhou

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS

Comments To appear in Proc. IEEE ASRU Workshop 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.04890 2019-11-13 eess.AS cs.CL cs.CV cs.LG cs.SD 82%

Recurrent Neural Network Transducer for Audio-Visual Speech Recognition

Takaki Makino, Hank Liao, Yannis Assael, Brendan Shillingford, Basilio Garcia, Otavio Braga, Olivier Siohan

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS

Comments Will be presented in 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.01700 2019-09-09 cs.CL cs.CV cs.SD eess.AS 82%

DurIAN: Duration Informed Attention Network For Multimodal Synthesis

Chengzhu Yu, Heng Lu, Na Hu, Meng Yu, Chao Weng, Kun Xu, Peng Liu, Deyi Tuo, Shiyin Kang, Guangzhi Lei, Dan Su, Dong Yu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.06752 2019-08-20 cs.SD cs.CV cs.LG cs.MM eess.AS 82%

Towards Generating Ambisonics Using Audio-Visual Cue for Virtual Reality

Aakanksha Rana, Cagri Ozcinar, Aljoscha Smolic

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.05962 2019-06-17 eess.AS cs.CL cs.CV cs.SD 82%

Speaker-Targeted Audio-Visual Models for Speech Recognition in Cocktail-Party Environments

Guan-Lin Chao, William Chan, Ian Lane

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、eess.AS

Comments Published in INTERSPEECH 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.01342 2019-05-28 cs.CV cs.MM cs.SD eess.AS 82%

AVA-ActiveSpeaker: An Audio-Visual Dataset for Active Speaker Detection

Joseph Roth, Sourish Chaudhuri, Ondrej Klejch, Radhika Marvin, Andrew Gallagher, Liat Kaver, Sharadh Ramaswamy, Arkadiusz Stopczynski, Cordelia Schmid, Zhonghua Xi, Caroline Pantofaru

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.03094 2019-04-22 cs.CV cs.MM cs.SD eess.AS 82%

Deep Multimodal Clustering for Unsupervised Audiovisual Learning

Di Hu, Feiping Nie, Xuelong Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by CVPR2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.08409 2018-07-03 cs.CL cs.CV cs.SD eess.AS 82%

End-to-End Audio Visual Scene-Aware Dialog using Multimodal Attention-Based Video Features

Chiori Hori, Huda Alamri, Jue Wang, Gordon Wichern, Takaaki Hori, Anoop Cherian, Tim K. Marks, Vincent Cartillier, Raphael Gontijo Lopes, Abhishek Das, Irfan Essa, Dhruv Batra, Devi Parikh

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

Comments A prototype system for the Audio Visual Scene-aware Dialog (AVSD) at DSTC7

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.00344 2018-03-21 cs.CL cs.AI cs.CV 82%

A Deep Learning Approach for Multimodal Deception Detection

Gangeshwar Krishnamurthy, Navonil Majumder, Soujanya Poria, Erik Cambria

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted at the 19th International Conference on Computational Linguistics and Intelligent Text Processing (CICLing), 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05295 2025-10-14 cs.SD cs.AI cs.MM 82%

AUREXA-SE: Audio-Visual Unified Representation Exchange Architecture with Cross-Attention and Squeezeformer for Speech Enhancement

M. Sajid, Deepanshu Gupta, Yash Modi, Sanskriti Jain, Harshith Jai Surya Ganji, A. Rahaman, Harshvardhan Choudhary, Nasir Saleem, Amir Hussain, M. Tanveer

机构 * Indian Institute of Technology Indore(印度理工学院印第安纳分校) School of Computing, Edinburgh Napier University(爱丁堡纳皮尔大学计算机学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM

Journal ref INTERSPEECH 2025 - 4th COG-MHEAR Workshop on Audio-Visual Speech Enhancement (AVSEC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00536 2024-01-02 cs.CL cs.AI 82%

A Multi-Task, Multi-Modal Approach for Predicting Categorical and Dimensional Emotions

Alex-Răzvan Ispas, Théo Deschamps-Berger, Laurence Devillers

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI;multimodal(comments)

Comments Companion Publication of the 25th International Conference on Multimodal Interaction (pp. 311-317)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.04440 2023-05-18 eess.AS cs.MM cs.SD 82%

Multimodal Approach for Assessing Neuromotor Coordination in Schizophrenia Using Convolutional Neural Networks

Yashish M. Siriwardena, Chris Kitchen, Deanna L. Kelly, Carol Espy-Wilson

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

Comments 5 pages. arXiv admin note: text overlap with arXiv:2102.07054

Journal ref Proceedings of the 2021 International Conference on Multimodal Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.07732 2023-03-15 cs.SD cs.CV cs.LG eess.AS 82%

Learning Audio-Visual Dereverberation

Changan Chen, Wei Sun, David Harwath, Kristen Grauman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Accepted at ICASSP 2023. This is the longer version of the five-page camera-ready paper. Project page: https://vision.cs.utexas.edu/projects/learning-audio-visual-dereverberation

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01938 2022-11-08 cs.CL cs.AI cs.LG 82%

Shapes of Emotions: Multimodal Emotion Recognition in Conversations via Emotion Shifts

Harsh Agarwal, Keshav Bansal, Abhinav Joshi, Ashutosh Modi

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 13 pages, Accepted at Workshop on Performance and Interpretability Evaluations of Multimodal, Multipurpose, Massive-Scale Models, COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10910 2022-02-23 cs.SD cs.CV cs.RO eess.AS 82%

Sound Adversarial Audio-Visual Navigation

Yinfeng Yu, Wenbing Huang, Fuchun Sun, Changan Chen, Yikai Wang, Xiaohong Liu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments This work aims to do an adversarial sound intervention for robust audio-visual navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.10202 2021-11-22 eess.AS cs.CL cs.SD 82%

Multimodal Emotion Recognition with High-level Speech and Text Features

Mariana Rodrigues Makiuchi, Kuniaki Uto, Koichi Shinoda

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted at ASRU 2021. Code available at https://github.com/mmakiuchi/multimodal_emotion_recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.09207 2020-08-24 eess.AS cs.CL cs.SD 82%

Dyadic Speech-based Affect Recognition using DAMI-P2C Parent-child Multimodal Interaction Dataset

Huili Chen, Yue Zhang, Felix Weninger, Rosalind Picard, Cynthia Breazeal, Hae Won Park

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted by the 2020 International Conference on Multimodal Interaction (ICMI'20)

详情

展开后加载摘要…

URL PDF HTML 收藏