Multi-modal Multi-channel Target Speech Separation
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 eess.AS
Comments accepted in IEEE Journal of Selcted Topics in Signal Processing
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 eess.AS
Comments accepted in IEEE Journal of Selcted Topics in Signal Processing
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL
专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 eess.AS
Comments Accepted to INTERSPEECH 2020
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 eess.AS
Comments 34 pages, 8 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 eess.AS
Comments Rephrased some sentenced. Explanation about OpenPose. Minor grammatical errors
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments To appear in ECCV 2020
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI
Comments 20 pages, 6 figures, 1 table 16/06/2020: Updated version includes expanded discussion and addition of new references. Also updated author affiliation information. This version has been accepted for publication with Frontiers
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 eess.AS
Comments Submitted to INTERSPEECH 2020
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM
Comments 5 pages
Journal ref 2019 27th European Signal Processing Conference (EUSIPCO), IEEE, 2019, pp 1-5
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL
Comments Accepted by AAAI2020 DSTC8 workshop. Ranked 1st in DSTC8-AVSD track
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments 10 pages, 7 figures, Preprint accepted for publication in the Proceedings of the 2nd International Workshop on Computer Vision for Physiological Measurement as part of ICCV. Seoul, South Korea. 2019
Journal ref Proceedings of the 2nd International Workshop on Computer Vision for Physiological Measurement as part of ICCV. Seoul, South Korea. 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
Comments 12 pages
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments 8 Pages, IEEE Conference on Games 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 eess.AS
Comments In ICMI'18, October 16-20, 2018, Boulder, CO, USA. Equation (2) corrected on this version
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to CVPR 2019
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments 11 pages, 4 figures
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments 6 pages
专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);audio-visual(abstract);分类 cs.MM
Comments 14 pages, 10 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Comments 23 pages, 7 figures
专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV
Comments Tech. report
专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 eess.AS
Comments 5 pages, 3 figures, Accepted and to appear at ICASSP 2018
专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
Comments Have some problems need to be handled
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Presented at NIPS 2017's Visually-Grounded Interaction and Language Workshop
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
Journal ref IEEE Access (Year: 2017, Volume: PP, Issue: 99 )
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、eess.AS
Journal ref ICMI '23: INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION, Oct 2023, Paris, France. pp.750-754
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、eess.AS
Comments Accepted to 25th ACM International Conference on Multimodal Interaction (ICMI 2023)
专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM;multimodal(comments)
Comments Accepted by AAAI 2022 De-Factify Workshop: First Workshop on Multimodal Fact-Checking and Hate Speech Detection
AVE-Compass:迈向音频-视频编辑能力的整体评估
专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM
AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。
OASIS:一个多语言多模态数据集用于文化导向的语音视觉问答
机构 * Qatar Computing Research Institute(卡塔尔计算研究 institute)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI;multimodal foundation model(comments)
AI总结 OASIS是一个多语言多模态数据集,涵盖图像、文本和语音,旨在评估模型在现实场景中的文化导向推理能力,包含0.92M真实图像和14.8M问答对。
Comments Multimodal Foundation Models, Large Language Models, Native, Multilingual, Language Diversity, Contextual Understanding, Culturally Informed