arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2204.11420 2022-04-26 cs.CV cs.MM cs.SD eess.AS 85%

Audio-Visual Scene Classification Using A Transfer Learning Based Joint Optimization Strategy

Chengxin Chen, Meng Wang, Pengyuan Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments 5 pages, 2 figures, based on the work that won first place in the challenge of DCASE2021 Task 1B

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.08509 2022-02-18 cs.SD cs.AI cs.CV cs.LG eess.AS 85%

A Study of Designing Compact Audio-Visual Wake Word Spotting System Based on Iterative Fine-Tuning in Neural Network Pruning

Hengshun Zhou, Jun Du, Chao-Han Huck Yang, Shifu Xiong, Chin-Hui Lee

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments Accepted to ICASSP 2022. H. Zhou et al

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.01697 2021-12-06 cs.CV cs.CL cs.LG cs.SD eess.AS 85%

LMR-CBT: Learning Modality-fused Representations with CB-Transformer for Multimodal Emotion Recognition from Unaligned Multimodal Sequences

Ziwang Fu, Feng Liu, Hanyang Wang, Siyuan Shen, Jiahao Zhang, Jiayin Qi, Xiangling Fu, Aimin Zhou

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments 9 pages ,Figure 2, Table 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.13180 2021-07-29 cs.MM cs.CV cs.SD eess.AS eess.IV 85%

Squeeze-Excitation Convolutional Recurrent Neural Networks for Audio-Visual Scene Classification

Javier Naranjo-Alcazar, Sergi Perez-Castanos, Aaron Lopez-Garcia, Pedro Zuccarello, Maximo Cobos, Francesc J. Ferri

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08510 2021-04-26 cs.MM cs.CV cs.SD eess.AS 85%

Exploring Deep Learning for Joint Audio-Visual Lip Biometrics

Meng Liu, Longbiao Wang, Kong Aik Lee, Hanyi Zhang, Chang Zeng, Jianwu Dang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.13780 2021-04-23 cs.CV cs.CL cs.SD eess.AS 85%

Cross-modal Speaker Verification and Recognition: A Multilingual Perspective

Muhammad Saad Saeed, Shah Nawaz, Pietro Morerio, Arif Mahmood, Ignazio Gallo, Muhammad Haroon Yousaf, Alessio Del Bue

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL、eess.AS

Comments Accepted: CVPRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07074 2020-11-05 cs.SD cs.CV cs.MM eess.AS 85%

FaceFilter: Audio-visual speech separation using still images

Soo-Whan Chung, Soyeon Choe, Joon Son Chung, Hong-Goo Kang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Under submission as a conference paper. Video examples: https://youtu.be/ku9xoLh62E

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05789 2020-08-19 cs.MM cs.AI cs.CV cs.LG 85%

Look, Listen, and Attend: Co-Attention Network for Self-Supervised Audio-Visual Representation Learning

Ying Cheng, Ruize Wang, Zhihao Pan, Rui Feng, Yuejie Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments Accepted by the 28th ACM International Conference on Multimedia (ACM MM 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.00251 2020-02-04 cs.MM cs.CV cs.IR cs.SD eess.AS 85%

Multi-Modal Music Information Retrieval: Augmenting Audio-Analysis with Visual Computing for Improved Music Video Analysis

Alexander Schindler

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

Comments Dissertation at TU Wien

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.10131 2019-12-27 cs.MM cs.CL cs.SD eess.AS 85%

Leveraging Topics and Audio Features with Multimodal Attention for Audio Visual Scene-Aware Dialog

Shachi H Kumar, Eda Okur, Saurav Sahay, Jonathan Huang, Lama Nachman

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.MM、eess.AS

Comments Presented at the 3rd Visually Grounded Interaction and Language (ViGIL) Workshop, NeurIPS 2019, Vancouver, Canada. arXiv admin note: substantial text overlap with arXiv:1812.08407, arXiv:1912.10132

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.05250 2019-04-24 cs.CL cs.CV cs.SD eess.AS 85%

Modality Attention for End-to-End Audio-visual Speech Recognition

Pan Zhou, Wenwen Yang, Wei Chen, Yanfeng Wang, Jia Jia

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、eess.AS

Comments accepted by ICASSP2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03739 2025-10-22 cs.CL cs.AI 84%

VITA-Audio: Fast Interleaved Cross-Modal Token Generation for Efficient Large Speech-Language Model

Zuwei Long, Yunhang Shen, Chaoyou Fu, Heting Gao, Lijiang Li, Peixian Chen, Mengdan Zhang, Hang Shao, Jian Li, Jinlong Peng, Haoyu Cao, Ke Li, Rongrong Ji, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) Xiamen University(厦门大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI;MLLM(comments)

Comments Training and Inference Codes: https://github.com/VITA-MLLM/VITA-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07016 2025-06-17 cs.CV cs.AI 84%

MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks

Sanjoy Chowdhury, Mohamed Elmoghany, Yohan Abeysinghe, Junjie Fei, Sayan Nag, Salman Khan, Mohamed Elhoseiny, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学College Park分校) KAUST(卡尔斯兰大学) MBZUAI(马克斯·普朗克人工智能研究所) University of Toronto(多伦多大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

Comments Audio-visual learning, Audio-Visual RAG, Multi-Video Linkage

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09579 2022-08-23 cs.CV cs.AI 84%

Learning in Audio-visual Context: A Review, Analysis, and New Perspective

Yake Wei, Di Hu, Yapeng Tian, Xuelong Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments https://gewu-lab.github.io/audio-visual-learning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.11583 2021-04-08 cs.CV cs.LG cs.RO cs.SD eess.AS 84%

Semantic Audio-Visual Navigation

Changan Chen, Ziad Al-Halah, Kristen Grauman

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

Comments Project page: http://vision.cs.utexas.edu/projects/semantic-audio-visual-navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07355 2026-05-29 cs.MM cs.SD 84%

AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues

AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力

Dingkun Zhou, Krish Patel, Ajay Kankipati, Akshaj Gupta, Zeyi Austin Li, Mohul Shukla, Vibhor Narang, Sara Kofman, Zongli Ye, Grace Wang, Xiaoyu Shi, Tingle Li, Guan-Ting Lin, Kan Jen Cheng, Huang-Cheng Chou, Jiachen Lian, Gopala Anumanchipalli

机构 * UC Berkeley(加州大学伯克利分校) South China University of Technology(华南理工大学) Zhejiang University(浙江大学) National Taiwan University(台湾大学) University of Southern California(美国南加州大学)

专题命中 音频语音多模态 :audio-visual(title);omni-modal(title);分类 cs.MM

AI总结 提出AV-EMO-Reasoning基准,通过合成和真实世界的视听对话数据集及情感感知与交互推理指标,系统评估全模态大语言模型的情感推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 84%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20267 2026-04-23 cs.SD cs.AI 84%

ATIR: Towards Audio-Text Interleaved Contextual Retrieval

ATIR:面向音频-文本交错上下文检索

Tong Zhao, Chenghao Zhang, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 音频语音多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出ATIR任务,通过整合ASR、QA和检索数据集构建基准,解决现有音频检索数据集在语义检索上的局限,引入新的token压缩机制提升MLLM在ATIR中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16102 2025-10-27 cs.CV cs.RO 84%

HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues

Xiwen Li, Xiaoya Tang, Tolga Tasdizen

机构 * Scientific Computing and Imaging Institute(科学计算与成像研究所) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Utah(犹他大学)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 84%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22794 2026-07-28 cs.LG cs.AI cs.CL cs.SD 新提交 84%

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练

Ali Tabaraei, Federico Simonetta, Stavros Ntalampiras

机构 * University of Milan(米兰大学) Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。

Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07294 2026-07-09 cs.RO cs.AI cs.CL 新提交 84%

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器

Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

机构 * i Intelligent Insights(4i智能洞察公司) Universidad de Sevilla(塞维利亚大学) Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) Honda Research Institute Japan(本田日本研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。

Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06611 2026-07-09 cs.CL cs.AI cs.LG cs.SD 新提交 84%

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

通过生成的多语言转录本的蒸馏和跨模态集成进行音频情感分析

Andrei-George Durdun, Victor Constantinescu, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学) PPC Romania(罗马尼亚PPC)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究语音情感分析难题,提出通过跨模态变压器集成音频与文本信息的多模态方案,经自动语音识别生成转录本并翻译为多语言文本,还进行知识蒸馏,实验证明该方法能提升多模态情感分类性能及增强单模态音频模型。

Comments Accepted at KES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03825 2026-07-07 cs.CV cs.AI 新提交 84%

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

Q-TriM:用于视听问答的问题引导三模态注意力

SungHun Kim, SeungJun Baek

机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20117 2026-06-30 cs.CV cs.SD eess.AS 84%

Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation

通过解耦音频语义实现延迟双向对齐的音频视觉分割

Jingqi Tian, Yiheng Du, Haoji Zhang, Yuji Wang, Isaac Ning Lee, Xulong Bai, Tianrui Zhu, Jingxuan Niu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 本文提出DDAVS方法,通过解耦音频语义和延迟双向对齐解决音频视觉分割中的多源纠缠和视听错位问题,实验表明其在多种场景下均取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24286 2026-06-24 cs.CL cs.CV 新提交 84%

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Huawei Inc.(华为技术有限公司)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23063 2026-06-23 cs.CV cs.AI 新提交 84%

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

注意力谱正则化:无回放的连续多模态大语言模型

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出注意力谱正则化(ASR),一种无回放的连续学习框架,通过存储技能级交叉注意力原型分布并施加谱正则化约束,有效缓解多模态大语言模型在连续微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07033 2026-06-08 cs.AI cs.CV 新提交 84%

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

层次化语义约束异构图用于音视频事件定位

Zhe Yang, Ruyi Zhang, Hongtao Chen, Wenrui Li, Hengyu Man, Wangmeng Zuo, Xiaopeng Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出层次化语义约束异构图框架,通过构建异构图、双向语义约束和双曲空间层次正则化,解决开放词汇音视频事件定位中跨尺度一致性和层次语义一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02724 2026-06-03 cs.CV cs.AI 84%

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

AVTrack: 以人为中心的复杂场景中的视听跟踪

Yaoting Wang, Yun Zhou, Zipei Zhang, Henghui Ding

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有视听跟踪数据集局限于简单场景的问题,提出AVTrack数据集,通过包含相机运动、视觉遮挡和位置变化等复杂动态条件,评估并提升鲁棒的人为中心视听场景理解。

Comments 19 pages, 10 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00125 2026-06-02 cs.IR cs.AI cs.LG cs.MM 84%

Multimodal Music Recommendation System using LLMs

使用LLMs的多模态音乐推荐系统

Srikar Prabhas Kandagatla, Sreehitha R. Narayana, Chandana Magapu, Swetha Mohan, Shamanth Kuthpadi, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt, Nesreen Ahmed

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Dolby Laboratories(Dolby实验室) Adobe Research(Adobe研究) Cisco Research(Cisco研究)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 提出一个多模态框架,通过融合音频、歌词、LLM生成的语义元数据和收听完成率,在基于会话的音乐推荐中显著提升Recall和NDCG。

详情

展开后加载摘要…

URL PDF HTML 收藏