arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2210.05242 2024-02-07 cs.CV cs.AI 84%

Leveraging the Video-level Semantic Consistency of Event for Audio-visual Event Localization

Yuanyuan Jiang, Jianqin Yin, Yonghao Dang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 10 figures, Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07336 2024-01-17 eess.AS cs.AI cs.SD eess.SP 84%

Construction and Evaluation of Mandarin Multimodal Emotional Speech Database

Zhu Ting, Li Liangqi, Duan Shufei, Zhang Xueying, Xiao Zhongzhe, Jia Hairng, Liang Huizhi

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04210 2024-01-10 cs.CV cs.AI cs.CL cs.MM cs.SD eess.AS 84%

FunnyNet-W: Multimodal Learning of Funny Moments in Videos in the Wild

Zhi-Song Liu, Robin Courant, Vicky Kalogeiton

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01146 2023-12-19 cs.CV cs.LG cs.SD eess.AS 84%

AVSegFormer: Audio-Visual Segmentation with Transformer

Shengyi Gao, Zhe Chen, Guo Chen, Wenhai Wang, Tong Lu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06337 2023-12-12 cs.SD cs.CL eess.AS 84%

Deep Imbalanced Learning for Multimodal Emotion Recognition in Conversations

Tao Meng, Yuntao Shou, Wei Ai, Nan Yin, Keqin Li

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19264 2023-10-31 cs.MM cs.SD eess.AS 84%

Sound of Story: Multi-modal Storytelling with Audio

Jaeyeon Bae, Seokhoon Jeong, Seokun Kang, Namgi Han, Jae-Yon Lee, Hyounghun Kim, Taehwan Kim

专题命中 音频语音多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.MM、eess.AS

Comments Findings of EMNLP 2023, project: https://github.com/Sosdatasets/SoS_Dataset/

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02088 2023-10-17 cs.CV cs.GR cs.SD eess.AS 84%

AV-NeRF: Learning Neural Fields for Real-World Audio-Visual Scene Synthesis

Susan Liang, Chao Huang, Yapeng Tian, Anurag Kumar, Chenliang Xu

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02234 2023-10-17 cs.CV cs.AI cs.LG 84%

MIS-AVoiDD: Modality Invariant and Specific Representation for Audio-Visual Deepfake Detection

Vinaya Sree Katamneni, Ajita Rattani

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17343 2023-10-03 cs.CV cs.SD eess.AS 84%

Modality-Independent Teachers Meet Weakly-Supervised Audio-Visual Event Parser

Yung-Hsuan Lai, Yen-Chun Chen, Yu-Chiang Frank Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05281 2023-09-12 cs.CV cs.LG cs.MM 84%

Class-Incremental Grouping Network for Continual Audio-Visual Learning

Shentong Mo, Weiguo Pian, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments ICCV 2023. arXiv admin note: text overlap with arXiv:2303.17056

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.00572 2023-09-06 stat.ML cs.AI cs.CV cs.LG 84%

XFlow: Cross-modal Deep Neural Networks for Audiovisual Classification

Cătălina Cangea, Petar Veličković, Pietro Liò

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at the IEEE ICDL-EPIROB 2017 Workshop on Computational Models for Crossmodal Learning (CMCML), 4 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05421 2023-08-11 cs.CV cs.MM 84%

Progressive Spatio-temporal Perception for Audio-Visual Question Answering

Guangyao Li, Wenxuan Hou, Di Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12745 2023-08-07 cs.CV cs.AI 84%

Audio-Visual Deception Detection: DOLOS Dataset and Parameter-Efficient Crossmodal Learning

Xiaobao Guo, Nithish Muthuchamy Selvaraj, Zitong Yu, Adams Wai-Kin Kong, Bingquan Shen, Alex Kot

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10813 2023-07-21 cs.CV cs.SD eess.AS eess.IV 84%

Perceptual Quality Assessment of Omnidirectional Audio-visual Signals

Xilei Zhu, Huiyu Duan, Yuqin Cao, Yuxin Zhu, Yucheng Zhu, Jing Liu, Li Chen, Xiongkuo Min, Guangtao Zhai

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments 12 pages, 5 figures, to be published in CICAI2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08581 2023-07-18 cs.CV cs.AI 84%

BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs

Yang Zhao, Zhijie Lin, Daquan Zhou, Zilong Huang, Jiashi Feng, Bingyi Kang

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01233 2023-06-26 cs.CV cs.MM 84%

On Uni-Modal Feature Learning in Supervised Multi-Modal Learning

Chenzhuang Du, Jiaye Teng, Tingle Li, Yichen Liu, Tianyuan Yuan, Yue Wang, Yang Yuan, Hang Zhao

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16794 2023-06-06 cs.CL cs.SD eess.AS 84%

MMER: Multimodal Multi-task Learning for Speech Emotion Recognition

Sreyan Ghosh, Utkarsh Tyagi, S Ramaneswaran, Harshvardhan Srivastava, Dinesh Manocha

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments InterSpeech 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15403 2023-05-25 cs.CL cs.SD eess.AS 84%

AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation

Rongjie Huang, Huadai Liu, Xize Cheng, Yi Ren, Linjun Li, Zhenhui Ye, Jinzheng He, Lichao Zhang, Jinglin Liu, Xiang Yin, Zhou Zhao

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

Comments Accepted to ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12701 2023-05-23 cs.SD cs.MM eess.AS 84%

More Perspectives Mean Better: Underwater Target Recognition and Localization with Multimodal Data via Symbiotic Transformer and Multiview Regression

Shipei Liu, Xiaoya Fan, Guowei Wu

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14757 2023-03-01 cs.MM cs.IR cs.SD eess.AS 84%

Audio Retrieval for Multimodal Design Documents: A New Dataset and Algorithms

Prachi Singh, Srikrishna Karanam, Sumit Shekhar

专题命中 音频语音多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.MM、eess.AS

Comments 5 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.02671 2023-02-01 cs.SD cs.CV eess.AS 84%

Canonical Cortical Graph Neural Networks and its Application for Speech Enhancement in Audio-Visual Hearing Aids

Leandro A. Passos, João Paulo Papa, Amir Hussain, Ahsan Adeel

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00753 2022-10-04 cs.SD cs.LG cs.MM eess.AS 84%

Push-Pull: Characterizing the Adversarial Robustness for Audio-Visual Active Speaker Detection

Xuanjun Chen, Haibin Wu, Helen Meng, Hung-yi Lee, Jyh-Shing Roger Jang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.MM、eess.AS

Comments Accepted by SLT 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01768 2022-09-07 cs.MM cs.SD eess.AS 84%

Predict-and-Update Network: Audio-Visual Speech Recognition Inspired by Human Speech Perception

Jiadong Wang, Xinyuan Qian, Haizhou Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10141 2022-07-22 cs.SD cs.CV eess.AS 84%

AudioScopeV2: Audio-Visual Attention Architectures for Calibrated Open-Domain On-Screen Sound Separation

Efthymios Tzinis, Scott Wisdom, Tal Remez, John R. Hershey

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

Comments ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05500 2022-07-13 cs.CV cs.MM 84%

Modality-Aware Contrastive Instance Learning with Self-Distillation for Weakly-Supervised Audio-Visual Violence Detection

Jiashuo Yu, Jinyu Liu, Ying Cheng, Rui Feng, Yuejie Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02090 2022-07-01 cs.CV cs.IR cs.SD eess.AS 84%

VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices

Venkatesh S. Kadandale, Juan F. Montesinos, Gloria Haro

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、eess.AS

Comments Paper accepted to Interspeech 2022; Project Page: https://ipcv.github.io/VocaLiST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.12065 2022-06-29 cs.CV cs.AI 84%

DeepStroke: An Efficient Stroke Screening Framework for Emergency Rooms with Multimodal Adversarial Deep Learning

Tongan Cai, Haomiao Ni, Mingli Yu, Xiaolei Huang, Kelvin Wong, John Volpi, James Z. Wang, Stephen T. C. Wong

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.03804 2022-03-15 cs.CL cs.AI 84%

CI-AVSR: A Cantonese Audio-Visual Speech Dataset for In-car Command Recognition

Wenliang Dai, Samuel Cahyawijaya, Tiezheng Yu, Elham J. Barezi, Peng Xu, Cheuk Tung Shadow Yiu, Rita Frieske, Holy Lovenia, Genta Indra Winata, Qifeng Chen, Xiaojuan Ma, Bertram E. Shi, Pascale Fung

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06406 2022-02-15 cs.CV cs.SD eess.AS 84%

Visual Sound Localization in the Wild by Cross-Modal Interference Erasing

Xian Liu, Rui Qian, Hang Zhou, Di Hu, Weiyao Lin, Ziwei Liu, Bolei Zhou, Xiaowei Zhou

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、eess.AS

Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2022. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.04279 2022-01-13 cs.CV cs.LG cs.RO cs.SD eess.AS 84%

Dynamical Audio-Visual Navigation: Catching Unheard Moving Sound Sources in Unmapped 3D Environments

Abdelrahman Younes

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏