Multimodal Attention Merging for Improved Speech Recognition and Audio Event Classification
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments 5 pages, 1 figure, ICASSP 2024 Workshop on Self-supervision in Audio, Speech and Beyond
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments 5 pages, 1 figure, ICASSP 2024 Workshop on Self-supervision in Audio, Speech and Beyond
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted by IEEE Transactions on Affective Computing
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
Comments Accepted at AAAI2024
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV
Comments Accepted at 46th European Conference on Information Retrieval (ECIR 2024)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL
Comments Accepted by ICASSP 2024
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 18 pages
Journal ref Appl. Sci. 2022, 12, 4785
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments AAAI Camera Ready. Dawei Hao and Yuxin Mao contribute equality to this paper. Yiran Zhong is the corresponding author. The code will be released at https://github.com/OpenNLPLab/AVS-bidirectional
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments ICCV 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted by ICASSP 2024
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL
Comments 12 pages, 1 figure
Journal ref Volume 14163 of Lecture Notes in Computer Science, pages 48-59, Springer, 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
Comments Accepted at WACV 2024
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Comments 19 pages, 18 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted to VUA workshop at BMVC 2023
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Accepted By IEEE Signal Processing Letter
Journal ref IEEE Signal Processing Letters, vol. 29, p. 2582-2586, 2022
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments IEEE BigData 2023. 10 pages
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
Comments 8 pages, Published in International Conference on Computers and Computation (COMPUTE 2022), November 03-04, 2022, San Francisco, United States
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Submmited to IEEE/ACM Transactions on Audio, Speech and Language Processing. arXiv admin note: text overlap with arXiv:2305.14933
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Published in InterSpeech 2023
Journal ref Proc. INTERSPEECH 2023, 844-848 (2023)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Journal ref Conference on Neural Information Processing Systems (NeurIPS 2023)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments 13 pages, 5 figures, conference
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted to NeurIPS 2023
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL
Comments 7 pages, 3 figures
Journal ref Proceedings of the 2023 IEEE Robot and Human Interactive Communication Conference