arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4559 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4559 篇

2405.13860 2024-05-24 cs.CV 79%

MAGIC: Map-Guided Few-Shot Audio-Visual Acoustics Modeling

Diwei Huang, Kunyang Lin, Peihao Chen, Qing Du, Mingkui Tan

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments 17 pages, 12 pages for main paper, 5 pages for supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04327 2024-05-08 cs.CV 79%

Audio-Visual Speech Representation Expert for Enhanced Talking Face Video Generation and Evaluation

Dogucan Yaman, Fevziye Irem Eyiokur, Leonard Bärmann, Seymanur Aktı, Hazım Kemal Ekenel, Alexander Waibel

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments CVPR2024 NTIRE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03901 2024-05-08 cs.HC cs.AI 79%

OmniActions: Predicting Digital Actions in Response to Real-World Multimodal Sensory Inputs with LLMs

Jiahao Nick Li, Yan Xu, Tovi Grossman, Stephanie Santosa, Michelle Li

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments Paper accepted to the 2024 CHI Conference on Human Factors in Computing Systems (CHI 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03254 2024-05-08 eess.AS 79%

Automatic Assessment of Dysarthria Using Audio-visual Vowel Graph Attention Network

Xiaokang Liu, Xiaoxia Du, Juan Liu, Rongfeng Su, Manwa Lawrence Ng, Yumei Zhang, Yudong Yang, Shaofeng Zhao, Lan Wang, Nan Yan

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments 10 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03152 2024-05-08 eess.AS cs.SD 79%

MMGER: Multi-modal and Multi-granularity Generative Error Correction with LLM for Joint Accent and Speech Recognition

Bingshen Mu, Yangze Li, Qijie Shao, Kun Wei, Xucheng Wan, Naijun Zheng, Huan Zhou, Lei Xie

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.09649 2024-05-03 cs.HC cs.CL 79%

ReactGenie: A Development Framework for Complex Multimodal Interactions Using Large Language Models

Jackie Junrui Yang, Yingtian Shi, Yuhan Zhang, Karina Li, Daniel Wan Rosli, Anisha Jain, Shuning Zhang, Tianshi Li, James A. Landay, Monica S. Lam

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17391 2024-04-29 cs.LG cs.AI cs.CY cs.HC 79%

M3BAT: Unsupervised Domain Adaptation for Multimodal Mobile Sensing with Multi-Branch Adversarial Training

Lakmal Meegahapola, Hamza Hassoune, Daniel Gatica-Perez

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments Accepted at the Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies (IMWUT). Paper will be presented at ACM UbiComp 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00834 2024-04-25 cs.SD cs.CV 79%

AV-RIR: Audio-Visual Room Impulse Response Estimation

Anton Ratnarajah, Sreyan Ghosh, Sonal Kumar, Purva Chiniya, Dinesh Manocha

专题命中 音频语音多模态 :audio-visual(title);multi-modal(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09509 2024-04-16 cs.CV 79%

Fuse after Align: Improving Face-Voice Association Learning via Multimodal Encoder

Chong Peng, Liqiang He, Dan Su

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08156 2024-04-15 cs.CL 79%

Multimodal Contextual Dialogue Breakdown Detection for Conversational AI Models

Md Messal Monem Miah, Ulie Schnaithmann, Arushi Raghuvanshi, Youngseo Son

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments Published in NAACL 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05559 2024-04-10 cs.CV 79%

TIM: A Time Interval Machine for Audio-Visual Action Recognition

Jacob Chalk, Jaesung Huh, Evangelos Kazakos, Andrew Zisserman, Dima Damen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted to CVPR 2024. Project Webpage: https://jacobchalk.github.io/TIM-Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19080 2024-04-03 cs.CV cs.CR 79%

MMCert: Provable Defense against Adversarial Attacks to Multi-modal Models

Yanting Wang, Hongye Fu, Wei Zou, Jinyuan Jia

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

Comments To appear in CVPR'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04798 2024-04-03 cs.CL cs.LG 79%

JMI at SemEval 2024 Task 3: Two-step approach for multimodal ECAC using in-context learning with GPT and instruction-tuned Llama models

Arefa, Mohammed Abbas Ansari, Chandni Saxena, Tanvir Ahmad

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

Comments Paper Accepted at SemEval 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12687 2024-04-01 cs.CV cs.LG 79%

Audio-Visual Compound Expression Recognition Method based on Late Modality Fusion and Rule-based Decision

Elena Ryumina, Maxim Markitantov, Dmitry Ryumin, Heysem Kaya, Alexey Karpov

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19554 2024-03-29 cs.CV 79%

Cross-Attention is Not Always Needed: Dynamic Cross-Attention for Audio-Visual Dimensional Emotion Recognition

R. Gnana Praveen, Jahangir Alam

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted at IEEE ICME2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18323 2024-03-28 cs.NI cs.MM 79%

How to Cache Important Contents for Multi-modal Service in Dynamic Networks: A DRL-based Caching Scheme

Zhe Zhang, Marc St-Hilaire, Xin Wei, Haiwei Dong, Abdulmotaleb El Saddik

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM

Journal ref IEEE Transactions on Multimedia (Early Access), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17936 2024-03-27 cs.CV 79%

ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture Synthesis

Muhammad Hamza Mughal, Rishabh Dabral, Ikhsanul Habibie, Lucia Donatelli, Marc Habermann, Christian Theobalt

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

Comments CVPR 2024. Project Page: https://vcai.mpi-inf.mpg.de/projects/ConvoFusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10744 2024-03-26 cs.SD cs.CV 79%

An Audio-Visual Speech Separation Model Inspired by Cortico-Thalamo-Cortical Circuits

Kai Li, Fenghua Xie, Hang Chen, Kexin Yuan, Xiaolin Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments Accepted by TPAMI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03907 2024-03-25 cs.CV 79%

Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation

Bolin Lai, Fiona Ryan, Wenqi Jia, Miao Liu, James M. Rehg

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11037 2024-03-19 eess.AS cs.SD 79%

Fine-Grained Engine Fault Sound Event Detection Using Multimodal Signals

Dennis Fedorishin, Livio Forte, Philip Schneider, Srirangaraj Setlur, Venu Govindaraju

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

Comments Accepted to ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10689 2024-03-19 cs.RO cs.CV cs.LG 79%

Latent Object Characteristics Recognition with Visual to Haptic-Audio Cross-modal Transfer Learning

Namiko Saito, Joao Moura, Hiroki Uchida, Sethu Vijayakumar

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06354 2024-03-12 cs.CL 79%

Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages

Michael Andersland

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04866 2024-03-11 cs.AI 79%

A Modular End-to-End Multimodal Learning Method for Structured and Unstructured Data

Marco D Alessandro, Enrique Calabrés, Mikel Elkano

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16124 2024-02-27 cs.CV 79%

AVI-Talking: Learning Audio-Visual Instructions for Expressive 3D Talking Face Generation

Yasheng Sun, Wenqing Chu, Hang Zhou, Kaisiyuan Wang, Hideki Koike

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14579 2024-02-26 cs.CV 79%

Real-Time Idling Vehicles Detection using Combined Audio-Visual Deep Learning

Xiwen Li, Tristalee Mangin, Surojit Saha, Evan Blanchard, Dillon Tang, Henry Poppe, Nathan Searle, Ouk Choi, Kerry Kelly, Ross Whitaker

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13851 2024-02-22 cs.CV 79%

VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models

Jiawei Liang, Siyuan Liang, Man Luo, Aishan Liu, Dongchen Han, Ee-Chien Chang, Xiaochun Cao

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11297 2024-02-20 cs.CL 79%

MMMModal -- Multi-Images Multi-Audio Multi-turn Multi-Modal

Husein Zolkepli, Aisyah Razak, Kamarul Adha, Ariff Nazhan

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01967 2024-02-20 cs.CL 79%

MasonPerplexity at Multimodal Hate Speech Event Detection 2024: Hate Speech and Target Detection Using Transformer Ensembles

Amrita Ganguly, Al Nahian Bin Emran, Sadiya Sayara Chowdhury Puspo, Md Nishat Raihan, Dhiman Goswami, Marcos Zampieri

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09245 2024-02-15 eess.AS cs.LG eess.SP 79%

Overview of the L3DAS23 Challenge on Audio-Visual Extended Reality

Christian Marinoni, Riccardo Fosco Gramaccioni, Changan Chen, Aurelio Uncini, Danilo Comminiello

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted to 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07327 2024-02-13 cs.AI 79%

Multi-Modal Emotion Recognition by Text, Speech and Video Using Pretrained Transformers

Minoo Shayaninasab, Bagher Babaali

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏