arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4559 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4559 篇

2306.01100 2023-06-05 eess.AS cs.LG cs.SD 79%

ALO-VC: Any-to-any Low-latency One-shot Voice Conversion

Bohan Wang, Damien Ronssin, Milos Cernak

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

Comments Accepted to Interspeech 2023. Some audio samples are available at https://bohan7.github.io/ALO-VC-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00160 2023-06-02 eess.AS cs.LG cs.SD 79%

Audio-Visual Speech Separation in Noisy Environments with a Lightweight Iterative Model

Héctor Martel, Julius Richter, Kai Li, Xiaolin Hu, Timo Gerkmann

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07677 2023-05-26 cs.SD cs.CL cs.LG 79%

Masked Audio Text Encoders are Effective Multi-Modal Rescorers

Jinglun Cai, Monica Sunkara, Xilai Li, Anshu Bhatia, Xiao Pan, Sravan Bodapati

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15084 2023-05-25 cs.CV 79%

Audio-Visual Dataset and Method for Anomaly Detection in Traffic Videos

Błażej Leporowski, Arian Bakhtiarnia, Nicole Bonnici, Adrian Muscat, Luca Zanella, Yiming Wang, Alexandros Iosifidis

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11310 2023-05-22 cs.HC cs.LG cs.SD eess.AS 79%

AMII: Adaptive Multimodal Inter-personal and Intra-personal Model for Adapted Behavior Synthesis

Jieyeon Woo, Mireille Fares, Catherine Pelachaud, Catherine Achard

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10773 2023-05-19 eess.SP cs.AI 79%

Rate-Adaptive Coding Mechanism for Semantic Communications With Multi-Modal Data

Yangshuo He, Guanding Yu, Yunlong Cai

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13115 2023-05-15 cs.CV 79%

AVFace: Towards Detailed Audio-Visual 4D Face Reconstruction

Aggelina Chatziagapi, Dimitris Samaras

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 cs.CV

Comments Accepted by CVPR 2023. Project page: https://aggelinacha.github.io/AVFace/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06315 2023-05-02 eess.SP cs.SD eess.AS q-bio.NC 79%

Brain Connectivity Features-based Age Group Classification using Temporal Asynchrony Audio-Visual Integration Task

Prerna Singh, Ayush Tripathi, Lalan Kumar, Tapan Kumar Gandhi

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01080 2023-04-04 cs.SD cs.RO eess.AS 79%

LIPSFUS: A neuromorphic dataset for audio-visual sensory fusion of lip reading

Antonio Rios-Navarro, Enrique Piñero-Fuentes, Salvador Canas-Moreno, Aqib Javed, Jin Harkin, Alejandro Linares-Barranco

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Submitted to ISCAS2023, 4 pages, plus references, github link provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09406 2023-04-04 cs.LG cs.MM 79%

Dance Style Transfer with Cross-modal Transformer

Wenjie Yin, Hang Yin, Kim Baraka, Danica Kragic, Mårten Björkman

专题命中 音频语音多模态 :cross-modal(title);multimodal(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15430 2023-03-30 cs.CL cs.LG 79%

TextMI: Textualize Multimodal Information for Integrating Non-verbal Cues in Pre-trained Language Models

Md Kamrul Hasan, Md Saiful Islam, Sangwu Lee, Wasifur Rahman, Iftekhar Naim, Mohammed Ibrahim Khan, Ehsan Hoque

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01767 2023-03-29 cs.CV 79%

Self-Supervised Video Forensics by Audio-Visual Anomaly Detection

Chao Feng, Ziyang Chen, Andrew Owens

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11302 2023-03-28 cs.CV 79%

Learning Audio-Visual Source Localization via False Negative Aware Contrastive Learning

Weixuan Sun, Jiayi Zhang, Jianyuan Wang, Zheyuan Liu, Yiran Zhong, Tianpeng Feng, Yandong Guo, Yanhao Zhang, Nick Barnes

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14240 2023-03-24 eess.AS 79%

Dialogue Enhancement and Listening Effort in Broadcast Audio: A Multimodal Evaluation

Matteo Torcoli, Thomas Robotham, Emanuël A. P. Habets

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Paper accepted to 14th International Conference on Quality of Multimedia Experience (QoMEX), Lippstadt, Germany, 2022 - version 2 fixes some typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10033 2023-03-20 cs.CV 79%

Multi-modal Expression Recognition with Ensemble Method

Chuanhe Liu, Xinjie Zhang, Xiaolong Liu, Tenggan Zhang, Liyu Meng, Yuchen Liu, Yuanyuan Deng, Wenqiang Jiang

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09057 2023-03-17 eess.AS cs.SD 79%

TriAAN-VC: Triple Adaptive Attention Normalization for Any-to-Any Voice Conversion

Hyun Joon Park, Seok Woo Yang, Jin Sob Kim, Wooseok Shin, Sung Won Han

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

Comments To appear in ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08295 2023-03-16 eess.SP cs.SD eess.AS 79%

A large-scale multimodal dataset of human speech recognition

Yao Ge, Chong Tang, Haobo Li, Zikang Zhang, Wenda Li, Kevin Chetty, Daniele Faccio, Qammer H. Abbasi, Muhammad Imran

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.07005 2023-03-14 eess.AS 79%

Real-Time Audio-Visual End-to-End Speech Enhancement

Zirun Zhu, Hemin Yang, Min Tang, Ziyi Yang, Sefik Emre Eskimez, Huaming Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02348 2023-03-07 cs.SD eess.AS 79%

The DKU Post-Challenge Audio-Visual Wake Word Spotting System for the 2021 MISP Challenge: Deep Analysis

Haoxu Wang, Ming Cheng, Qiang Fu, Ming Li

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract);分类 eess.AS

Comments Accepted by ICASSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.11532 2023-02-28 cs.SD eess.AS 79%

Key-Sparse Transformer for Multimodal Speech Emotion Recognition

Weidong Chen, Xiaofeng Xing, Xiangmin Xu, Jichen Yang, Jianxin Pang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments This paper was accepted by ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.06127 2023-02-20 eess.AS cs.SD eess.SP 79%

MM-ALT: A Multimodal Automatic Lyric Transcription System

Xiangming Gu, Longshen Ou, Danielle Ong, Ye Wang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Accepted by ACM Multimedia 2022. Camera ready version and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13190 2023-01-31 cs.CV 79%

Audio-Visual Segmentation with Semantics

Jinxing Zhou, Xuyang Shen, Jianyuan Wang, Jiayi Zhang, Weixuan Sun, Jing Zhang, Stan Birchfield, Dan Guo, Lingpeng Kong, Meng Wang, Yiran Zhong

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Submitted to TPAMI as a journal extension of ECCV 2022. Jinxing Zhou, Xuyang Shen, and Jianyuan Wang contribute equally to this work. Meng Wang and Yiran Zhong are the corresponding authors. Code is available at https://github.com/OpenNLPLab/AVSBench. Online benchmark is available at http://www.avlbench.opennlplab.cn. arXiv admin note: substantial text overlap with arXiv:2207.05042

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.00145 2023-01-03 cs.CV 79%

Attentional Graph Convolutional Network for Structure-aware Audio-Visual Scene Classification

Liguang Zhou, Yuhongze Zhou, Xiaonan Qi, Junjie Hu, Tin Lun Lam, Yangsheng Xu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06887 2022-11-28 cs.HC cs.CV cs.LG 79%

AVCAffe: A Large Scale Audio-Visual Dataset of Cognitive Load and Affect for Remote Work

Pritam Sarkar, Aaron Posen, Ali Etemad

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted in AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.00970 2022-11-23 eess.AS cs.SD 79%

Self-supervised Learning of Audio Representations from Audio-Visual Data using Spatial Alignment

Shanshan Wang, Archontis Politis, Annamaria Mesaros, Tuomas Virtanen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.10885 2022-11-22 cs.SD eess.AS 79%

Contrastive Regularization for Multimodal Emotion Recognition Using Audio and Text

Fan Qian, Jiqing Han

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Completed in October 2020 and submitted to ICASSP2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09980 2022-11-21 cs.CV 79%

Contrastive Positive Sample Propagation along the Audio-Visual Event Line

Jinxing Zhou, Dan Guo, Meng Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted to TPAMI; Dataset and Code are available at https://github.com/jasongief/CPSP. arXiv admin note: substantial text overlap with arXiv:2104.00239

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05543 2022-11-11 cs.SD cs.LG eess.AS 79%

Vis2Mus: Exploring Multimodal Representation Mapping for Controllable Music Generation

Runbang Zhang, Yixiao Zhang, Kai Shao, Ying Shan, Gus Xia

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Submitted to ICASSP 2023. GitHub repo: https://github.com/ldzhangyx/vis2mus

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15385 2022-10-28 eess.AS cs.SD eess.SP 79%

Self-Supervised Training of Speaker Encoder with Multi-Modal Diverse Positive Pairs

Ruijie Tao, Kong Aik Lee, Rohan Kumar Das, Ville Hautamäki, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03051 2022-10-25 cs.RO cs.AI cs.LG 79%

Perceive, Represent, Generate: Translating Multimodal Information to Robotic Motion Trajectories

Fábio Vital, Miguel Vasco, Alberto Sardinha, Francisco Melo

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments 14 pages, 4 figures, 8 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏