APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
机构 * Beijing Normal University(北京师范大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
机构 * Beijing Normal University(北京师范大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments ICASSP 2025
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments 7pages
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
Comments Paper Accepted at Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023
专题命中 音视频/视觉语言融合 :information fusion(abstract)
Comments accpeted by interspeech 2014, 5 pages, 1 figure
专题命中 音视频/视觉语言融合 :information fusion(abstract)
Comments InterSpeech 2024
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments Accepted to the 21th ACM Conference on Embedded Networked Sensor Systems (SenSys 2023)
专题命中 音视频/视觉语言融合 :information fusion(abstract)
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
Comments Accepted camera-ready version for INTERSPEECH 2023
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments 5 pages, 2 figures, 4 tables
Journal ref Published in ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
Comments 2 pages, accepted by ICASSP 2023
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract)
Comments 5 pages, conference
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments Accepted by ACM MM 2022 (Main Track, Long Paper)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments arXiv admin note: text overlap with arXiv:2107.00648 by other authors
Journal ref Pre-print for our paper at International Conference on Speech & Language Technology for Low-resource Languages (SPELLL'2022)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments This paper is accepted by IEEE Transactions on Multimedia. This version addresses some mistakes and typos in the original paper. The appendix is available at https://github.com/TmacMai/Multimodal-Information-Bottleneck/blob/main/appendix.pdf
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Journal ref In Proceedings of the 2022 International Conference on Multimodal Interaction, pp. 690-695. 2022
专题命中 音视频/视觉语言融合 :information fusion(abstract)
Comments 7 pages, 1 figures, Accecpted by Proceedings of the 1st International Workshop on Deepfake Detection for Audio Multimedia
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments https://dstc10.dstc.community/home and https://github.com/dialogtekgeek/AVSD-DSTC10_Official/
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
Comments INTERSPEECH 2021. arXiv admin note: substantial text overlap with arXiv:2106.09668