arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2508.07608 2025-08-12 cs.MM cs.CV cs.SD eess.AS 85%

AD-AVSR: Asymmetric Dual-stream Enhancement for Robust Audio-Visual Speech Recognition

Junxiao Xue, Xiaozhen Liu, Xuecheng Wu, Xinyi Yin, Danlei Huang, Fei Yu

机构 * Zhengzhou University(郑州大学) Zhejiang Lab(浙江实验室) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by the ACM MM 2025 Workshop on SVC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00733 2025-08-08 cs.SD cs.CV cs.MM eess.AS 85%

AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation

Le Wang, Jun Wang, Chunyu Qiang, Feng Deng, Chen Zhang, Di Zhang, Kun Gai

机构 * China University of Mining and Technology(中国矿业大学) Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04418 2025-08-07 cs.MM cs.CV cs.MA cs.SD eess.AS 85%

Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation

Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Project page: https://github.com/jasongief/TGS-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02849 2025-08-06 eess.AS cs.AI cs.CL cs.SD 85%

SecoustiCodec: Cross-Modal Aligned Streaming Single-Codecbook Speech Codec

Chunyu Qiang, Haoyu Wang, Cheng Gong, Tianrui Wang, Ruibo Fu, Tao Wang, Ruilong Chen, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Longbiao Wang, Jianwu Dang, Jianhua Tao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Kuaishou Technology(快手科技) Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) Department of Automation, BNRist, Tsinghua University(自动化系,北研所,清华大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16579 2025-07-02 cs.CV cs.MM cs.SD eess.AS 85%

Contrastive Conditional Latent Diffusion for Audio-visual Segmentation

Yuxin Mao, Jing Zhang, Mochu Xiang, Yunqiu Lv, Dong Li, Yiran Zhong, Yuchao Dai

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子与信息学院,西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Key Laboratory of Information Acquisition and Processing(信息获取与处理陕西省重点实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Journal ref IEEE Transactions on Image Processing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19774 2025-06-25 eess.AS cs.AI cs.CL cs.SD 85%

Kling-Foley: Multimodal Diffusion Transformer for High-Quality Video-to-Audio Generation

Jun Wang, Xijuan Zeng, Chunyu Qiang, Ruilong Chen, Shiyao Wang, Le Wang, Wangjing Zhou, Pengfei Cai, Jiahui Zhao, Nan Li, Zihan Li, Yuzhe Liang, Xiaopeng Wang, Haorui Zheng, Ming Wen, Kang Yin, Yiran Wang, Nan Li, Feng Deng, Liang Dong, Chen Zhang, Di Zhang, Kun Gai

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02621 2025-06-04 cs.SD 85%

Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge

Zhaoyang Li, Haodong Zhou, Longjie Luo, Xiaoxiao Li, Yongxin Chen, Lin Li, Qingyang Hong

机构 * Xiamen University(厦门大学) Beijing Jiaotong University(北京交通大学) School of Electronic Science and Engineering(电子科学与技术学院) School of Electronic Information(电子信息学院) School of Informatics(信息学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05758 2025-05-29 eess.AS cs.AI cs.CL cs.SD 85%

VQ-CTAP: Cross-Modal Fine-Grained Sequence Representation Learning for Speech Processing

Chunyu Qiang, Wang Geng, Yi Zhao, Ruibo Fu, Tao Wang, Cheng Gong, Tianrui Wang, Qiuyu Liu, Jiangyan Yi, Zhengqi Wen, Chen Zhang, Hao Che, Longbiao Wang, Jianwu Dang, Jianhua Tao

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) Kuaishou Technology Co., Ltd.(快手科技有限公司) Tianjin Key Laboratory of Cognitive Computing and Application, College of Intelligence and Computing, Tianjin University(认知计算与应用重点实验室,智能计算学院,天津大学) Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学) Migu Culture Technology Co., Ltd.(咪咕文化科技有限公司) Shenzhen Institute of Advanced Technology, Chinese Academy of Science(深圳先进技术研究院,中国科学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20027 2025-05-27 q-bio.NC cs.AI cs.CL cs.LG eess.AS eess.IV 85%

Multi-modal brain encoding models for multi-modal stimuli

Subba Reddy Oota, Khushbu Pahwa, Mounika Marreddy, Maneesh Singh, Manish Gupta, Bapi S. Raju

机构 * Technische Universität Berlin(柏林技术大学) Rice Univ(莱斯大学) Univ of Bonn(波恩大学) Spector Inc(Spector公司) Microsoft(微软) IIIT Hyderabad(海得拉巴国家理工学院)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

Comments 26 pages, 15 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=0dELcFHig2

Journal ref ICLR-2025, Sinapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01237 2025-05-22 cs.MM cs.CV cs.SD eess.AS 85%

CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment

Edson Araujo, Andrew Rouditchenko, Yuan Gong, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Leonid Karlinsky, Rogerio Feris, James R. Glass, Hilde Kuehne

机构 * Goethe University of Frankfurt(法兰克福歌德大学) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments To be published at CVPR 2025, code available at https://github.com/edsonroteia/cav-mae-sync

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16936 2025-04-25 cs.MM cs.CV cs.SD eess.AS 85%

Multifaceted Evaluation of Audio-Visual Capability for MLLMs: Effectiveness, Efficiency, Generalizability and Robustness

Yusheng Zhao, Junyu Luo, Xiao Luo, Weizhi Zhang, Zhiping Xiao, Wei Ju, Philip S. Yu, Ming Zhang

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12315 2025-04-18 cs.CL cs.AI cs.CV 85%

Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models

Xingguang Ji, Jiakang Wang, Hongzhi Zhang, Jingyuan Zhang, Haonan Zhou, Chenxi Sun, Yahui Liu, Qi Wang, Fuzheng Zhang

专题命中 音频语音多模态 :omni-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06884 2025-04-10 cs.MM cs.AI cs.CV 85%

Audio-visual Event Localization on Portrait Mode Short Videos

Wuyang Liu, Yi Chai, Yongpeng Yan, Yanzhen Ren

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02061 2025-04-04 cs.CV cs.MM cs.SD eess.AS 85%

Aligned Better, Listen Better for Audio-Visual Large Language Models

Yuxin Guo, Shuailei Ma, Shijie Ma, Xiaoyi Bao, Chen-Wei Xie, Kecheng Zheng, Tingyu Weng, Siyang Sun, Yun Zheng, Wei Zou

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08247 2025-04-01 cs.SD cs.CV cs.MM eess.AS 85%

MoMuSE: Momentum Multi-modal Target Speaker Extraction for Real-time Scenarios with Impaired Visual Cues

Junjie Li, Ke Zhang, Shuai Wang, Kong Aik Lee, Man-Wai Mak, Haizhou Li

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23219 2025-04-01 eess.AS cs.AI cs.CV cs.LG 85%

Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs

Sanjoy Chowdhury, Hanan Gani, Nishit Anand, Sayan Nag, Ruohan Gao, Mohamed Elhoseiny, Salman Khan, Dinesh Manocha

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21504 2025-03-28 cs.CL cs.AI cs.CV 85%

Keyword-Oriented Multimodal Modeling for Euphemism Identification

Yuxue Hu, Junsong Li, Meixuan Chen, Dongyu Su, Tongguan Wang, Ying Sha

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18709 2025-03-04 cs.CV cs.LG cs.MM cs.SD eess.AS 85%

Audio-Visual Instance Segmentation

Ruohao Guo, Xianghua Ying, Yaru Chen, Dantong Niu, Guangyao Li, Liao Qu, Yanyu Qi, Jinxing Zhou, Bowei Xing, Wenzhen Yue, Ji Shi, Qixun Wang, Peiliang Zhang, Buwen Liang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14893 2025-02-24 cs.CV cs.AI cs.LG cs.SD eess.AS 85%

NOTA: Multimodal Music Notation Understanding for Visual Large Language Model

Mingni Tang, Jiajia Li, Lu Yang, Zhiqiang Zhang, Jinghao Tian, Zuchao Li, Lefei Zhang, Ping Wang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16861 2024-12-31 cs.SD cs.CV cs.MM eess.AS 85%

SoundLoc3D: Invisible 3D Sound Source Localization and Classification Using a Multimodal RGB-D Acoustic Camera

Yuhang He, Sangyun Shin, Anoop Cherian, Niki Trigoni, Andrew Markham

专题命中 音频语音多模态 :multimodal(title);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted by WACV2025

Journal ref WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13543 2024-12-19 cs.CV cs.AI cs.CL 85%

Query-centric Audio-Visual Cognition Network for Moment Retrieval, Segmentation and Step-Captioning

Yunbin Tu, Liang Li, Li Su, Qingming Huang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09596 2024-12-13 cs.CV cs.AI cs.CL 85%

InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions

Pan Zhang, Xiaoyi Dong, Yuhang Cao, Yuhang Zang, Rui Qian, Xilin Wei, Lin Chen, Yifei Li, Junbo Niu, Shuangrui Ding, Qipeng Guo, Haodong Duan, Xin Chen, Han Lv, Zheng Nie, Min Zhang, Bin Wang, Wenwei Zhang, Xinyue Zhang, Jiaye Ge, Wei Li, Jingwen Li, Zhongying Tu, Conghui He, Xingcheng Zhang, Kai Chen, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Github Repo: https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-OmniLive

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09168 2024-12-13 cs.SD cs.CV cs.MM eess.AS 85%

YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls

Zihao Chen, Haomin Zhang, Xinhan Di, Haoyu Wang, Sizhe Shan, Junjie Zheng, Yunming Liang, Yihan Fan, Xinfa Zhu, Wenjie Tian, Yihua Wang, Chaofan Ding, Lei Xie

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07406 2024-12-11 cs.CV cs.MM cs.SD eess.AS 85%

Learning Self-Supervised Audio-Visual Representations for Sound Recommendations

Sudha Krishnamurthy

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Published in the Proceedings of the International Symposium on Visual Computing, 2021 https://dl.acm.org/doi/10.1007/978-3-030-90436-4_10

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06209 2024-12-10 cs.CV cs.MM cs.SD eess.AS 85%

Sound2Vision: Generating Diverse Visuals from Audio through Cross-Modal Latent Alignment

Kim Sung-Bin, Arda Senocak, Hyunwoo Ha, Tae-Hyun Oh

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02860 2024-11-06 cs.CV cs.LG cs.MM cs.SD eess.AS 85%

Continual Audio-Visual Sound Separation

Weiguo Pian, Yiyang Nan, Shijian Deng, Shentong Mo, Yunhui Guo, Yapeng Tian

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07115 2024-09-25 cs.SD cs.CV cs.LG cs.MM eess.AS 85%

Getting More for Less: Using Weak Labels and AV-Mixup for Robust Audio-Visual Speaker Verification

Anith Selvakumar, Homa Fashandi

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Accepted to INTERSPEECH 2024

Journal ref Proc. Interspeech 2024, 4728-4732

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00624 2024-08-02 eess.AS cs.CL cs.CV 85%

SynesLM: A Unified Approach for Audio-visual Speech Recognition and Translation via Language Model and Synthetic Data

Yichen Lu, Jiaqi Song, Xuankai Chang, Hengwei Bian, Soumi Maiti, Shinji Watanabe

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16171 2024-07-25 cs.CV cs.AI cs.MM 85%

Learning Trimodal Relation for Audio-Visual Question Answering with Missing Modality

Kyu Ri Park, Hong Joo Lee, Jung Uk Kim

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15046 2024-07-23 cs.CV cs.CL cs.MM 85%

Audio-visual training for improved grounding in video-text LLMs

Shivprasad Sagare, Hemachandran S, Kinshuk Sarabhai, Prashant Ullegaddi, Rajeshkumar SA

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏