arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2409.19710 2024-10-01 q-bio.NC cs.CL cs.LG cs.SD eess.AS eess.SP q-bio.QM 81%

A multimodal LLM for the non-invasive decoding of spoken text from brain recordings

Youssef Hmamouche, Ismail Chihab, Lahoucine Kdouri, Amal El Fallah Seghrouchni

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13523 2024-09-23 cs.CL cs.SD eess.AS 81%

EMMeTT: Efficient Multimodal Machine Translation Training

Piotr Żelasko, Zhehuai Chen, Mengru Wang, Daniel Galvez, Oleksii Hrinchuk, Shuoyang Ding, Ke Hu, Jagadeesh Balam, Vitaly Lavrukhin, Boris Ginsburg

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments 4 pages, submitted to ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09284 2024-09-17 cs.SD cs.MM eess.AS 81%

M$^{3}$V: A multi-modal multi-view approach for Device-Directed Speech Detection

Anna Wang, Da Liu, Zhiyu Zhang, Shengqiang Liu, Jie Gao, Yali Li

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08628 2024-09-16 cs.SD cs.MM eess.AS 81%

Rhythmic Foley: A Framework For Seamless Audio-Visual Alignment In Video-to-Audio Synthesis

Zhiqi Huang, Dan Luo, Jun Wang, Huan Liao, Zhiheng Li, Zhiyong Wu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11820 2024-09-13 cs.CV cs.AI 81%

Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation

Juncheng Ma, Peiwen Sun, Yaoting Wang, Di Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

Comments ECCV2024 poster. Project url: https://gewu-lab.github.io/stepping_stones

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02821 2024-09-12 cs.SD cs.AI cs.LG cs.RO eess.AS 81%

Sim2Real Transfer for Audio-Visual Navigation with Frequency-Adaptive Acoustic Field Prediction

Changan Chen, Jordi Ramos, Anshul Tomar, Kristen Grauman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

Comments Camera ready version for IROS 2024. Project page: https://vision.cs.utexas.edu/projects/sim2real/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05659 2024-09-10 cs.SD cs.MM eess.AS eess.IV 81%

Audio-Visual Speaker Diarization: Current Databases, Approaches and Challenges

Victoria Mingote, Alfonso Ortega, Antonio Miguel, Eduardo Lleida

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08673 2024-09-06 cs.CV cs.SD eess.AS 81%

Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation

Renjie Wu, Hu Wang, Feras Dayoub, Hsiang-Ting Chen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments AAAI-24 (Fixed some erros)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01011 2024-09-04 cs.CL cs.CV 81%

Multi-Modal Multi-Granularity Tokenizer for Chu Bamboo Slip Scripts

Yingfa Chen, Chenlong Hu, Cong Feng, Chenyang Song, Shi Yu, Xu Han, Zhiyuan Liu, Maosong Sun

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00119 2024-09-04 cs.LG cs.AI cs.CL 81%

Efficient Long-distance Latent Relation-aware Graph Neural Network for Multi-modal Emotion Recognition in Conversations

Yuntao Shou, Wei Ai, Jiayi Du, Tao Meng, Haiyan Liu, Nan Yin

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14441 2024-08-27 cs.CV cs.AI 81%

Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification

Mahrukh Awan, Asmar Nadeem, Muhammad Junaid Awan, Armin Mustafa, Syed Sameed Husain

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14402 2024-08-13 cs.SD cs.CL eess.AS 81%

XLAVS-R: Cross-Lingual Audio-Visual Speech Representation Learning for Noise-Robust Speech Perception

HyoJung Han, Mohamed Anwar, Juan Pino, Wei-Ning Hsu, Marine Carpuat, Bowen Shi, Changhan Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments ACL2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01249 2024-08-06 cs.AI cs.CL cs.LG 81%

Large AI Model Empowered Multimodal Semantic Communications

Feibo Jiang, Li Dong, Yubo Peng, Kezhi Wang, Kun Yang, Cunhua Pan, Xiaohu You

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE CM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21721 2024-08-01 cs.MM cs.AI 81%

Open-Vocabulary Audio-Visual Semantic Segmentation

Ruohao Guo, Liao Qu, Dantong Niu, Yanyu Qi, Wenzhen Yue, Ji Shi, Bowei Xing, Xianghua Ying

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM

Comments Accepted by ACM MM 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19224 2024-07-31 cs.SD cs.MM eess.AS 81%

RAVSS: Robust Audio-Visual Speech Separation in Multi-Speaker Scenarios with Missing Visual Cues

Tianrui Pan, Jie Liu, Bohan Wang, Jie Tang, Gangshan Wu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

Comments Accepted by MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19704 2024-07-30 eess.IV cs.MM cs.SD eess.AS 81%

UNQA: Unified No-Reference Quality Assessment for Audio, Image, Video, and Audio-Visual Content

Yuqin Cao, Xiongkuo Min, Yixuan Gao, Wei Sun, Weisi Lin, Guangtao Zhai

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15992 2024-07-24 cs.CL cs.SD eess.AS 81%

Multimodal Input Aids a Bayesian Model of Phonetic Learning

Sophia Zhi, Roger P. Levy, Stephan C. Meylan

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09519 2024-07-16 cs.AI cs.CL 81%

Putting GPT-4o to the Sword: A Comprehensive Evaluation of Language, Vision, Speech, and Multimodal Proficiency

Sakib Shahriar, Brady Lund, Nishith Reddy Mannuru, Muhammad Arbab Arshad, Kadhim Hayawi, Ravi Varma Kumar Bevara, Aashrith Mannuru, Laiba Batool

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07801 2024-07-12 eess.AS cs.CL cs.LG cs.SD 81%

AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning

Jongsuk Kim, Jiwon Shin, Junmo Kim

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

Comments Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07015 2024-07-10 cs.HC cs.MM cs.SD eess.AS 81%

A Framework for Multimodal Medical Image Interaction

Laura Schütz, Sasan Matinfar, Gideon Schafroth, Navid Navab, Merle Fairhurst, Arthur Wagner, Benedikt Wiestler, Ulrich Eck, Nassir Navab

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM、eess.AS

Comments Accepted for publication in IEEE TVCG; presentation at IEEE ISMAR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05023 2024-07-08 cs.CL cs.CV 81%

Towards Multimodal Sentiment Analysis Debiasing via Bias Purification

Dingkang Yang, Mingcheng Li, Dongling Xiao, Yang Liu, Kun Yang, Zhaoyu Chen, Yuzheng Wang, Peng Zhai, Ke Li, Lihua Zhang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03110 2024-07-04 cs.SD cs.AI eess.AS 81%

A Toolchain for Comprehensive Audio/Video Analysis Using Deep Learning Based Multimodal Approach (A use case of riot or violent context detection)

Lam Pham, Phat Lam, Tin Nguyen, Hieu Tang, Alexander Schindler

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18305 2024-06-27 cs.CL cs.AI 81%

S3: A Simple Strong Sample-effective Multimodal Dialog System

Elisei Rykov, Egor Malkershin, Alexander Panchenko

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17430 2024-06-26 cs.CL cs.SD eess.AS 81%

Towards Probing Speech-Specific Risks in Large Multimodal Models: A Taxonomy, Benchmark, and Insights

Hao Yang, Lizhen Qu, Ehsan Shareghi, Gholamreza Haffari

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08336 2024-06-25 cs.SD cs.CV eess.AS 81%

CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction

Xueyuan Chen, Dongchao Yang, Dingdong Wang, Xixin Wu, Zhiyong Wu, Helen Meng

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV、eess.AS

Comments Accepted by Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09502 2024-06-21 cs.LG cs.AI cs.MM 81%

EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning

Jongsuk Kim, Hyeongkeun Lee, Kyeongha Rho, Junmo Kim, Joon Son Chung

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM

Comments 15 pages, 3 figures; Accepted to ICML 2024 (camera ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04539 2024-06-14 cs.LG cs.CL cs.CV cs.IT math.IT stat.ML 81%

Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications

Paul Pu Liang, Chun Kai Ling, Yun Cheng, Alex Obolenskiy, Yudong Liu, Rohan Pandey, Alex Wilf, Louis-Philippe Morency, Ruslan Salakhutdinov

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments ICLR 2024, Code available at: https://github.com/pliang279/PID

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07854 2024-06-13 cs.SD cs.MM eess.AS 81%

Zero-Shot Fake Video Detection by Audio-Visual Consistency

Xiaolou Li, Zehua Liu, Chen Chen, Lantian Li, Li Guo, Dong Wang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

Comments to be published in INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07841 2024-06-13 cs.CV cs.CL 81%

Labeling Comic Mischief Content in Online Videos with a Multimodal Hierarchical-Cross-Attention Model

Elaheh Baharlouei, Mahsa Shafaei, Yigeng Zhang, Hugo Jair Escalante, Thamar Solorio

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07310 2024-06-12 eess.AS cs.CL cs.SD 81%

MM-KWS: Multi-modal Prompts for Multilingual User-defined Keyword Spotting

Zhiqi Ai, Zhiyong Chen, Shugong Xu

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS

Comments Accepted at INTERSPEECH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏