arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4559 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4559 篇

1909.05568 2019-12-02 cs.CV 79%

On the Effect of Observed Subject Biases in Apparent Personality Analysis from Audio-visual Signals

Ricardo Darío Pérez Principi, Cristina Palmero, Julio C. S. Jacques Junior, Sergio Escalera

专题命中 音频语音多模态 :audio-visual(title);multi-modal(abstract);分类 cs.CV

Comments Accepted in IEEE Transactions on Affective Computing (TAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03930 2019-11-12 eess.AS cs.LG cs.SD 79%

Robust Unsupervised Audio-visual Speech Enhancement Using a Mixture of Variational Autoencoders

Mostafa Sadeghi, Xavier Alameda-Pineda

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.13215 2019-11-12 cs.CL 79%

Transformer-based Cascaded Multimodal Speech Translation

Zixiu Wu, Ozan Caglayan, Julia Ive, Josiah Wang, Lucia Specia

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to IWSLT 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12605 2019-11-05 eess.AS cs.LG 79%

Deep-Learning-Based Audio-Visual Speech Enhancement in Presence of Lombard Effect

Daniel Michelsanti, Zheng-Hua Tan, Sigurdur Sigurdsson, Jesper Jensen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06250 2019-11-05 eess.AS cs.LG cs.SD eess.IV 79%

Effects of Lombard Reflex on the Performance of Deep-Learning-Based Audio-Visual Speech Enhancement Systems

Daniel Michelsanti, Zheng-Hua Tan, Sigurdur Sigurdsson, Jesper Jensen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06234 2019-11-05 eess.AS cs.LG cs.SD eess.IV 79%

On Training Targets and Objective Functions for Deep-Learning-Based Audio-Visual Speech Enhancement

Daniel Michelsanti, Zheng-Hua Tan, Sigurdur Sigurdsson, Jesper Jensen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.07193 2019-10-17 cs.NI cs.MM 79%

Scalable Intelligence-Enabled Networking with Traffic Engineering in 5G Scenarios for Future Audio-Visual-Tactile Internet

Yiqiang Sheng

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.04302 2019-09-11 cs.CL cs.LG 79%

Multimodal Embeddings from Language Models

Shao-Yen Tseng, Panayiotis Georgiou, Shrikanth Narayanan

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.03522 2019-09-10 cs.LG cs.SD eess.AS 79%

MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation

Xia Liang, Junmin Wu, Jing Cao

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.08696 2019-07-23 cs.IR cs.CL cs.LG stat.ML 79%

Multi-modal Sentiment Analysis using Deep Canonical Correlation Analysis

Zhongkai Sun, Prathusha K Sarma, William Sethares, Erik P. Bucy

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01615 2019-07-04 cs.LG cs.AI 79%

E-Sports Talent Scouting Based on Multimodal Twitch Stream Data

Anna Belova, Wen He, Ziyi Zhong

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03098 2019-06-10 cs.LG cs.AI cs.HC cs.RO stat.ML 79%

Multi-modal Active Learning From Human Data: A Deep Reinforcement Learning Approach

Ognjen Rudovic, Meiru Zhang, Bjorn Schuller, Rosalind W. Picard

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.07860 2019-04-24 cs.CV cs.LG 79%

Talking Face Generation by Adversarially Disentangled Audio-Visual Representation

Hang Zhou, Yu Liu, Ziwei Liu, Ping Luo, Xiaogang Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments AAAI Conference on Artificial Intelligence (AAAI 2019) Oral Presentation. Code, models, and video results are available on our webpage: https://liuziwei7.github.io/projects/TalkingFace.html

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.03865 2019-02-21 cs.CL 79%

Multimodal Grounding for Sequence-to-Sequence Speech Recognition

Ozan Caglayan, Ramon Sanabria, Shruti Palaskar, Loïc Barrault, Florian Metze

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments ICASSP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.06834 2019-02-18 cs.RO cs.CV cs.NE 79%

Neural Network Based Reinforcement Learning for Audio-Visual Gaze Control in Human-Robot Interaction

Stéphane Lathuilière, Benoit Massé, Pablo Mesejo, Radu Horaud

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Paper submitted to Pattern Recognition Letters

Journal ref Pattern Recognition Letters, vol. 118, 2019, 61-71

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.04397 2019-02-13 cs.IR cs.MM 79%

Cross-Modal Music Retrieval and Applications: An Overview of Key Methodologies

Meinard Müller, Andreas Arzt, Stefan Balke, Matthias Dorfer, Gerhard Widmer

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.MM

Journal ref IEEE Signal Processing Magazine (Volume: 36, Issue: 1, Jan. 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.04891 2019-01-30 cs.CL 79%

A Multimodal LSTM for Predicting Listener Empathic Responses Over Time

Zhi-Xuan Tan, Arushi Goel, Thanh-Son Nguyen, Desmond C. Ong

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.02108 2018-12-27 cs.CV 79%

Deep Audio-Visual Speech Recognition

Triantafyllos Afouras, Joon Son Chung, Andrew Senior, Oriol Vinyals, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted for publication by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1704.05915 2018-12-11 cs.HC cs.AI cs.DC 79%

User-driven Intelligent Interface on the Basis of Multimodal Augmented Reality and Brain-Computer Interaction for People with Functional Disabilities

S. Stirenko, Yu. Gordienko, T. Shemsedinov, O. Alienin, Yu. Kochura, N. Gordienko, A. Rojbi, J. R. López Benito, E. Artetxe González

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments 10 pages, 11 figures, 1 table, submitted to Future of Information and Communication Conference (FICC) 2018, 5-6 April 2018, Singapore

Journal ref In: Arai K., Kapoor S., Bhatia R. (eds) Advances in Information and Communication Networks. FICC 2018. Advances in Intelligent Systems and Computing, vol 886, pp.612-631. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12214 2018-11-30 cs.SD eess.AS 79%

Play as You Like: Timbre-enhanced Multi-modal Music Style Transfer

Chien-Yu Lu, Min-Xin Xue, Chia-Che Chang, Che-Rung Lee, Li Su

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10199 2018-11-27 cs.CV 79%

Cross-domain Deep Feature Combination for Bird Species Classification with Audio-visual Data

Bold Naranchimeg, Chao Zhang, Takuya Akashi

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04448 2018-11-13 cs.SD eess.AS 79%

A Multi-modal Deep Neural Network approach to Bird-song identification

Botond Fazeka, Alexander Schindler, Thomas Lidy, Andreas Rauber

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

Comments LifeCLEF 2017 working notes, Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.09725 2018-10-15 cs.CV cs.SD 79%

Audio-Visual Speaker Diarization Based on Spatiotemporal Bayesian Fusion

Israel D. Gebru, Silèye Ba, Xiaofei Li, Radu Horaud

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments 14 pages, 6 figures, 5 tables

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(6), 1086 - 1099, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.00108 2018-10-02 cs.CV 79%

Audio-Visual Speech Recognition With A Hybrid CTC/Attention Architecture

Stavros Petridis, Themos Stafylakis, Pingchuan Ma, Georgios Tzimiropoulos, Maja Pantic

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted to IEEE SLT 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.06708 2018-09-18 cs.CV 79%

Speech Map: A Statistical Multimodal Atlas of 4D Tongue Motion During Speech from Tagged and Cine MR Images

Jonghye Woo, Fangxu Xing, Maureen Stone, Jordan Green, Timothy G. Reese, Thomas J. Brady, Van J. Wedeen, Jerry L. Prince, Georges El Fakhri

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted at Journal of Computer Methods in Biomechanics and Biomedical Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04203 2018-09-13 cs.CL 79%

Multimodal neural pronunciation modeling for spoken languages with logographic origin

Minh Nguyen, Gia H. Ngo, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.05561 2018-08-17 cs.CV 79%

Emotion Recognition in Speech using Cross-Modal Transfer in the Wild

Samuel Albanie, Arsha Nagrani, Andrea Vedaldi, Andrew Zisserman

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

Comments Conference paper at ACM Multimedia 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.00118 2018-08-02 cs.CV cs.CR cs.HC 79%

Toward Multimodal Interaction in Scalable Visual Digital Evidence Visualization Using Computer Vision Techniques and ISS

Serguei A. Mokhov, Miao Song, Jashanjot Singh, Joey Paquet, Mourad Debbabi, Sudhir Mudur

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

Comments reformatted; ICPRAI 2018 conference proceedings, pp. 151-157, CENPARMI, Concordia University, Montreal

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.08612 2018-06-25 cs.CV 79%

Ad-Net: Audio-Visual Convolutional Neural Network for Advertisement Detection In Videos

Shervin Minaee, Imed Bouazizi, Prakash Kolan, Hossein Najafzadeh

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04121 2018-06-20 cs.CV cs.SD 79%

The Conversation: Deep Audio-Visual Speech Enhancement

Triantafyllos Afouras, Joon Son Chung, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments To appear in Interspeech 2018. We provide supplementary material with interactive demonstrations on http://www.robots.ox.ac.uk/~vgg/demo/theconversation

详情

展开后加载摘要…

URL PDF HTML 收藏