An Analysis of Speech Enhancement and Recognition Losses in Limited Resources Multi-talker Single Channel Audio-Visual ASR
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS
Comments 14 pages, 4 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments 34 pages, 11 figures, Submitted to Information Fusion
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS
Comments 13 Pages
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted for publication at Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to Interspeech 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to ICASSP 2019
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI
Comments Inaccurate scientific facts listed in document
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS
Journal ref in 2019 International Workshop on Multilayer Music Representation and Processing, Milano, IEEE 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :audio-visual(title);multi-modal(abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、eess.AS
Comments IROS 2018 Workshop on Crossmodal Learning for Intelligent Robotics
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS
Comments Accepted to NIPS 2018. v2 added the majority word baseline results and other minor fixes. arXiv admin note: text overlap with arXiv:1710.04087 by other authors
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
Comments Accepted to SIGGRAPH 2018. Project webpage: https://looking-to-listen.github.io
Journal ref ACM Trans. Graph. 37(4): 112:1-112:11 (2018)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS
Comments 5 Pages, 1 Figure, accepted at INTERSPEECH 2018
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Under review on Journal of Artificial Intelligence Research (JAIR) -- Special Track on Deep Learning, Knowledge Representation, and Reasoning
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
Comments Accepted in CICLing 2017
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments 10 pages, data and models available at http://www.cs.cornell.edu/~jhessel/cats/cats.html, Proceedings of WWW 2017
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.MM
Comments Accepted as Journal Publication in IEEE Intelligent Systems
Journal ref IEEE Intelligent Systems 31.6 (2016): 82-88
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments 7 pages, 8 figures
Journal ref Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Lausanne, Switzerland, IEEE publications, pp. 1082-1089 (2002)
机构 * Fudan University(复旦大学) ; Shanghai University of Finance and Economics(上海财经大学) ; ByteDance Inc(字节跳动公司)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments Project Page: https://github.com/henghuiding/Awesome-Multimodal-Referring-Segmentation
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2024 workshop. The 1st winning model in CVPR 2024 UG2+ challenge. The code and configuration of our method are available at https://github.com/dtc111111/Multi-Modal-UAV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Journal ref In Proceedings of the 2022 International Conference on Multimodal Interaction, pp. 690-695. 2022