arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4557 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4557 篇

2402.13152 2024-02-21 cs.CV cs.CL 81%

AnnoTheia: A Semi-Automatic Annotation Toolkit for Audio-Visual Speech Technologies

José-M. Acosta-Triana, David Gimeno-Gómez, Carlos-D. Martínez-Hinarejos

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.CL

Comments Accepted at the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16123 2024-02-08 cs.HC cs.AI cs.CV cs.LG 81%

Looking for a better fit? An Incremental Learning Multimodal Object Referencing Framework adapting to Individual Drivers

Amr Gomaa, Guillermo Reyes, Michael Feld, Antonio Krüger

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Proceedings of the 29th International Conference on Intelligent User Interfaces (IUI'24), March 18--21, 2024, in Greenville, SC, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02327 2024-02-07 cs.CV cs.SD eess.AS 81%

Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues

Tianxiang Chen, Zhentao Tan, Tao Gong, Qi Chu, Yue Wu, Bin Liu, Le Lu, Jieping Ye, Nenghai Yu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10109 2024-02-05 cs.CV cs.AI 81%

Enlighten-Your-Voice: When Multimodal Meets Zero-shot Low-light Image Enhancement

Xiaofeng Zhang, Zishan Xu, Hao Tang, Chaochen Gu, Wei Chen, Shanying Zhu, Xinping Guan

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments It needs revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17129 2024-01-31 cs.SD cs.AI eess.AS 81%

Enhanced Sound Event Localization and Detection in Real 360-degree audio-visual soundscapes

Adrian S. Roman, Baladithya Balamurugan, Rithik Pothuganti

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14185 2024-01-26 cs.SD cs.AI eess.AS 81%

TDFNet: An Efficient Audio-Visual Speech Separation Model with Top-down Fusion

Samuel Pegg, Kai Li, Xiaolin Hu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

Journal ref 2023 13th International Conference on Information Science and Technology (ICIST), Cairo, Egypt, 2023, pp. 243-252

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12039 2024-01-23 cs.CV cs.SD eess.AS 81%

Look, Listen and Recognise: Character-Aware Audio-Visual Subtitling

Bruno Korbar, Jaesung Huh, Andrew Zisserman

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Accepted for publication in ICASSP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02118 2024-01-23 cs.CL cs.AI 81%

TWIZ-v2: The Wizard of Multimodal Conversational-Stimulus

Rafael Ferreira, Diogo Tavares, Diogo Silva, Rodrigo Valério, João Bordalo, Inês Simões, Vasco Ramos, David Semedo, João Magalhães

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06390 2024-01-15 cs.SD cs.MM eess.AS 81%

LCB-net: Long-Context Biasing for Audio-Visual Speech Recognition

Fan Yu, Haoxu Wang, Xian Shi, Shiliang Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

Comments Accepted by ICASPP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06910 2024-01-10 eess.AS cs.CL cs.SD 81%

HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition

Soumya Dutta, Sriram Ganapathy

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、eess.AS

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03000 2024-01-09 cs.SD cs.AI cs.LG eess.AS 81%

Bridging Modalities: Knowledge Distillation and Masked Training for Translating Multi-Modal Emotion Recognition to Uni-Modal, Speech-Only Emotion Recognition

Muhammad Muaz, Nathan Paull, Jahnavi Malagavalli

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01650 2023-12-22 cs.CL cs.AI cs.LG 81%

MARRS: Multimodal Reference Resolution System

Halim Cagri Ates, Shruti Bhargava, Site Li, Jiarui Lu, Siddhardha Maddula, Joel Ruben Antony Moniz, Anil Kumar Nalamalapu, Roman Hoang Nguyen, Melis Ozyildirim, Alkesh Patel, Dhivya Piraviperumal, Vincent Renkens, Ankit Samal, Thy Tran, Bo-Hsiang Tseng, Hong Yu, Yuan Zhang, Rong Zou

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Sixth Workshop on Computational Models of Reference, Anaphora and Coreference (CRAC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01301 2023-12-19 cs.LG cs.AI cs.CE cs.CV cs.HC 81%

Churn Prediction via Multimodal Fusion Learning:Integrating Customer Financial Literacy, Voice, and Behavioral Data

David Hason Rudd, Huan Huo, Md Rafiqul Islam, Guandong Xu

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09369 2023-12-18 cs.SD cs.AI eess.AS 81%

Audio-visual fine-tuning of audio-only ASR models

Avner May, Dmitriy Serdyuk, Ankit Parag Shah, Otavio Braga, Olivier Siohan

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02730 2023-12-18 eess.AS cs.AI cs.SD 81%

Stylebook: Content-Dependent Speaking Style Modeling for Any-to-Any Voice Conversion using Only Speech Data

Hyungseob Lim, Kyungguen Byun, Sunkuk Moon, Erik Visser

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 cs.AI、eess.AS

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08998 2023-12-15 eess.AS cs.AI cs.SD eess.SP 81%

Design, construction and evaluation of emotional multimodal pathological speech database

Ting Zhu, Shufei Duan, Huizhi Liang, Wei Zhang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02931 2023-12-08 cs.CL cs.AI 81%

WhisBERT: Multimodal Text-Audio Language Modeling on 100M Words

Lukas Wolf, Greta Tuckute, Klemen Kotar, Eghbal Hosseini, Tamar Regev, Ethan Wilcox, Alex Warstadt

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Published at the BabyLM Challenge, a shared task co-sponsored by CMCL 2023 and CoNLL 2023, hosted by EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14275 2023-11-27 cs.CV cs.SD eess.AS 81%

Cooperative Dual Attention for Audio-Visual Speech Enhancement with Facial Cues

Feixiang Wang, Shuang Yang, Shiguang Shan, Xilin Chen

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Accepted to BMVC 2023 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10608 2023-11-02 cs.CV cs.SD eess.AS 81%

STHG: Spatial-Temporal Heterogeneous Graph Learning for Advanced Audio-Visual Diarization

Kyle Min

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Validation report for the Ego4D challenge at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19644 2023-10-31 eess.AS cs.MM 81%

Scenario-Aware Audio-Visual TF-GridNet for Target Speech Extraction

Zexu Pan, Gordon Wichern, Yoshiki Masuyama, Francois G. Germain, Sameer Khurana, Chiori Hori, Jonathan Le Roux

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

Comments Accepted by ASRU 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19581 2023-10-31 eess.AS cs.CV cs.SD 81%

Seeing Through the Conversation: Audio-Visual Speech Separation based on Diffusion Model

Suyeon Lee, Chaeyoung Jung, Youngjoon Jang, Jaehun Kim, Joon Son Chung

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Project page with demo: https://mm.kaist.ac.kr/projects/avdiffuss/

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07764 2023-10-31 cs.CV cs.SD eess.AS 81%

Intel Labs at Ego4D Challenge 2022: A Better Baseline for Audio-Visual Diarization

Kyle Min

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Validation report for the Ego4D challenge at ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14946 2023-10-24 cs.MM cs.SD eess.AS 81%

Intuitive Multilingual Audio-Visual Speech Recognition with a Single-Trained Model

Joanna Hong, Se Jin Park, Yong Man Ro

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

Comments EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07663 2023-10-12 eess.AS cs.CV cs.SD 81%

Deep Video Inpainting Guided by Audio-Visual Self-Supervision

Kyuyeon Kim, Junsik Jung, Woo Jae Kim, Sung-Eui Yoon

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Accepted at ICASSP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07654 2023-10-12 cs.CL cs.LG cs.SD eess.AS 81%

Audio-Visual Neural Syntax Acquisition

Cheng-I Jeff Lai, Freda Shi, Puyuan Peng, Yoon Kim, Kevin Gimpel, Shiyu Chang, Yung-Sung Chuang, Saurabhchand Bhati, David Cox, David Harwath, Yang Zhang, Karen Livescu, James Glass

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14030 2023-10-11 cs.CL cs.SD eess.AS 81%

Multimodal Speech Recognition for Language-Guided Embodied Agents

Allen Chang, Xiaoyuan Zhu, Aarav Monga, Seoho Ahn, Tejas Srinivasan, Jesse Thomason

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、eess.AS

Comments 5 pages, 5 figures

Journal ref Proceedings of Interspeech 2023, 1608-1612

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03456 2023-10-06 cs.CV cs.LG cs.MM 81%

Multi-Resolution Audio-Visual Feature Fusion for Temporal Action Localization

Edward Fish, Jon Weinbren, Andrew Gilbert

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10490 2023-10-04 cs.CR cs.AI cs.CL cs.LG 81%

Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs

Eugene Bagdasaryan, Tsung-Yin Hsieh, Ben Nassi, Vitaly Shmatikov

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01430 2023-10-04 cs.CL cs.AI 81%

Sarcasm in Sight and Sound: Benchmarking and Expansion to Improve Multimodal Sarcasm Detection

Swapnil Bhosale, Abhra Chaudhuri, Alex Lee Robert Williams, Divyank Tiwari, Anjan Dutta, Xiatian Zhu, Pushpak Bhattacharyya, Diptesh Kanojia

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15826 2023-09-28 cs.CL cs.SD eess.AS 81%

Cross-Modal Multi-Tasking for Speech-to-Text Translation via Hard Parameter Sharing

Brian Yan, Xuankai Chang, Antonios Anastasopoulos, Yuya Fujita, Shinji Watanabe

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏