arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2008.09622 2021-02-12 cs.CV cs.AI cs.LG cs.RO cs.SD 81%

Learning to Set Waypoints for Audio-Visual Navigation

Changan Chen, Sagnik Majumder, Ziad Al-Halah, Ruohan Gao, Santhosh Kumar Ramakrishnan, Kristen Grauman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

Comments Accepted to ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.07775 2021-02-11 eess.AS cs.MM cs.SD eess.IV 81%

Muse: Multi-modal target speaker extraction with visual cues

Zexu Pan, Ruijie Tao, Chenglin Xu, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

Comments Accepted by ICASSP2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.04144 2021-02-09 eess.AS cs.CV cs.SD 81%

Switching Variational Auto-Encoders for Noise-Agnostic Audio-visual Speech Enhancement

Mostafa Sadeghi, Xavier Alameda-Pineda

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.02480 2021-02-04 cs.CL cs.LG cs.SD eess.AS 81%

Face Landmark-based Speaker-Independent Audio-Visual Speech Enhancement in Multi-Talker Environments

Giovanni Morrone, Luca Pasa, Vadim Tikhanoff, Sonia Bergamaschi, Luciano Fadiga, Leonardo Badino

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments Proceedings of 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.03669 2021-01-19 cs.LG cs.AI cs.CV stat.ML 81%

See, Hear, Explore: Curiosity via Audio-Visual Association

Victoria Dean, Shubham Tulsiani, Abhinav Gupta

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.08312 2020-12-16 cs.LG cs.CL cs.SD eess.AS 81%

QUARC: Quaternion Multi-Modal Fusion Architecture For Hate Speech Classification

Deepak Kumar, Nalin Kumar, Subhankar Mishra

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted in Proc. of the 4th International Workshop on Dialog Systems (IWDS2021) in conjunction with the IEEE BigComp2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14334 2020-12-01 cs.SD cs.CV eess.AS 81%

Audio-visual Speech Separation with Adversarially Disentangled Visual Representation

Peng Zhang, Jiaming Xu, Jing shi, Yunzhe Hao, Bo Xu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08571 2020-11-19 eess.AS cs.CL cs.SD 81%

Audio-visual Multi-channel Recognition of Overlapped Speech

Jianwei Yu, Bo Wu, Rongzhi Gu, Shi-Xiong Zhang, Lianwu Chen, Yong Xu. Meng Yu, Dan Su, Dong Yu, Xunying Liu, Helen Meng

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments submitted to Interspeech 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.07430 2020-11-17 cs.CV cs.LG cs.SD eess.AS 81%

Audio-Visual Event Recognition through the lens of Adversary

Juncheng B Li, Kaixin Ma, Shuhui Qu, Po-Yao Huang, Florian Metze

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV、eess.AS

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.07065 2020-11-16 eess.AS cs.CL cs.HC cs.LG 81%

Multi-Modal Emotion Detection with Transfer Learning

Amith Ananthram, Kailash Karthik Saravanakumar, Jessica Huynh, Homayoon Beigi

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS

Comments 11 pages, 7 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.11129 2020-11-10 cs.MM cs.CL cs.IR cs.LG 81%

Cosine Similarity of Multimodal Content Vectors for TV Programmes

Saba Nazir, Taner Cagali, Chris Newell, Mehrnoosh Sadrzadeh

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM

Comments 3 pages, 1 figure, Machine Learning for Media Discovery (ML4MD) Workshop at ICML 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.02099 2020-11-05 cs.CL cs.SD eess.AS 81%

Augmenting Images for ASR and TTS through Single-loop and Dual-loop Multimodal Chain Framework

Johanes Effendi, Andros Tjandra, Sakriani Sakti, Satoshi Nakamura

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted at INTERSPEECH 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.01018 2020-11-03 cs.IR cs.CV cs.MM cs.SD 81%

AVECL-UMONS database for audio-visual event classification and localization

Mathilde Brousmiche, Stéphane Dupont, Jean Rouat

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.14368 2020-09-28 cs.CV cs.SD eess.AS 81%

VGGSound: A Large-scale Audio-Visual Dataset

Honglie Chen, Weidi Xie, Andrea Vedaldi, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments ICASSP2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.08083 2020-09-18 cs.CV cs.MM 81%

Crossing You in Style: Cross-modal Style Transfer from Music to Visual Arts

Cheng-Che Lee, Wan-Yi Lin, Yen-Ting Shih, Pei-Yi Patricia Kuo, Li Su

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.04107 2020-09-10 eess.AS cs.MM cs.SD eess.IV 81%

Multi-modal Attention for Speech Emotion Recognition

Zexu Pan, Zhaojie Luo, Jichen Yang, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

Comments Accepted by Interspeech2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.11769 2020-08-19 eess.AS cs.CL cs.SD 81%

Lite Audio-Visual Speech Enhancement

Shang-Yi Chuang, Yu Tsao, Chen-Chou Lo, Hsin-Min Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments Accepted to Interspeech 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.04237 2020-08-11 cs.CV cs.SD eess.AS 81%

Self-Supervised Learning of Audio-Visual Objects from Video

Triantafyllos Afouras, Andrew Owens, Joon Son Chung, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments ECCV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08213 2020-08-11 cs.CL cs.SD eess.AS 81%

Speech to Text Adaptation: Towards an Efficient Cross-Modal Distillation

Won Ik Cho, Donghyun Kwak, Ji Won Yoon, Nam Soo Kim

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS

Comments Interspeech 2020 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.02686 2020-08-07 eess.AS cs.LG cs.MM cs.SD 81%

Attentive Fusion Enhanced Audio-Visual Encoding for Transformer Based Robust Speech Recognition

Liangfa Wei, Jie Zhang, Junfeng Hou, Lirong Dai

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.00702 2020-08-04 eess.AS cs.CL 81%

Multimodal Semi-supervised Learning Framework for Punctuation Prediction in Conversational Speech

Monica Sunkara, Srikanth Ronanki, Dhanush Bekal, Sravan Bodapati, Katrin Kirchhoff

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted for Interspeech 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.13928 2020-07-29 cs.CV cs.CL cs.LG 81%

Variants of BERT, Random Forests and SVM approach for Multimodal Emotion-Target Sub-challenge

Hoang Manh Hung, Hyung-Jeong Yang, Soo-Hyung Kim, Guee-Sang Lee

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、cs.CL

Comments 3 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00812 2020-05-13 cs.CL cs.SD eess.AS 81%

MultiQT: Multimodal Learning for Real-Time Question Tracking in Speech

Jakob D. Havtorn, Jan Latko, Joakim Edin, Lasse Borgholt, Lars Maaløe, Lorenzo Belgrano, Nicolai F. Jacobsen, Regitze Sdun, Željko Agić

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted at ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.01777 2020-05-06 cs.CL cs.AI 81%

ADVISER: A Toolkit for Developing Multi-modal, Multi-domain and Socially-engaged Conversational Agents

Chia-Yu Li, Daniel Ortega, Dirk Väth, Florian Lux, Lindsey Vanderlyn, Maximilian Schmidt, Michael Neumann, Moritz Völkel, Pavel Denisov, Sabrina Jenne, Zorica Kacarevic, Ngoc Thang Vu

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments All authors contributed equally. Accepted to be presented at ACL - System demonstrations - 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.05645 2020-04-06 cs.CL cs.SD eess.AS 81%

Learning Alignment for Multimodal Emotion Recognition from Speech

Haiyang Xu, Hui Zhang, Kun Han, Yun Wang, Yiping Peng, Xiangang Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments InterSpeech 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.12747 2020-04-01 cs.CV cs.SD eess.AS 81%

ASR is all you need: cross-modal distillation for lip reading

Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV、eess.AS

Comments ICASSP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.11100 2020-03-26 cs.MM cs.CV cs.LG eess.IV 81%

How deep is your encoder: an analysis of features descriptors for an autoencoder-based audio-visual quality metric

Helard Martinez, Andrew Hines, Mylene C. Q. Farias

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.10695 2020-02-26 cs.CL cs.CV cs.LG 81%

Multimodal Transformer with Pointer Network for the DSTC8 AVSD Challenge

Hung Le, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CV、cs.CL

Comments Accepted at DSTC Workshop at AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.02957 2020-02-10 cs.CV cs.SD eess.AS eess.IV 81%

$M^3$T: Multi-Modal Continuous Valence-Arousal Estimation in the Wild

Yuan-Hang Zhang, Rulin Huang, Jiabei Zeng, Shiguang Shan, Xilin Chen

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、eess.AS

Comments 6 pages, technical report; submission to ABAW Challenge at FG 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.00477 2020-01-01 cs.CL cs.SD eess.AS 81%

Analyzing Utility of Visual Context in Multimodal Speech Recognition Under Noisy Conditions

Tejas Srinivasan, Ramon Sanabria, Florian Metze

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted to How2 Workshop, ICML 2019

详情

展开后加载摘要…

URL PDF HTML 收藏