ALO-VC: Any-to-any Low-latency One-shot Voice Conversion
专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS
Comments Accepted to Interspeech 2023. Some audio samples are available at https://bohan7.github.io/ALO-VC-demo/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS
Comments Accepted to Interspeech 2023. Some audio samples are available at https://bohan7.github.io/ALO-VC-demo/
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted by Interspeech 2023
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments 8 pages, 1 figure
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV
Comments Accepted by CVPR 2023. Project page: https://aggelinacha.github.io/AVFace/
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Submitted to ISCAS2023, 4 pages, plus references, github link provided
专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments CVPR 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments CVPR2023
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Paper accepted to 14th International Conference on Quality of Multimedia Experience (QoMEX), Lippstadt, Germany, 2022 - version 2 fixes some typos
专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV
专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS
Comments To appear in ICASSP 2023
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
Comments Accepted by ICASSP 2023
专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 eess.AS
Comments Accepted by ICASSP 2023
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments This paper was accepted by ICASSP 2022
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Accepted by ACM Multimedia 2022. Camera ready version and appendix
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Submitted to TPAMI as a journal extension of ECCV 2022. Jinxing Zhou, Xuyang Shen, and Jianyuan Wang contribute equally to this work. Meng Wang and Yiran Zhong are the corresponding authors. Code is available at https://github.com/OpenNLPLab/AVSBench. Online benchmark is available at http://www.avlbench.opennlplab.cn. arXiv admin note: substantial text overlap with arXiv:2207.05042
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted in AAAI 2023
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Completed in October 2020 and submitted to ICASSP2021
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments Accepted to TPAMI; Dataset and Code are available at https://github.com/jasongief/CPSP. arXiv admin note: substantial text overlap with arXiv:2104.00239
专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS
Comments Submitted to ICASSP 2023. GitHub repo: https://github.com/ldzhangyx/vis2mus
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS
Comments 13 pages
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments 14 pages, 4 figures, 8 tables, 1 algorithm