arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2506.11436 2025-12-11 cs.CV 87%

TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models

TAViS: 基于文本的音频视觉分割与基础模型

Ziyang Luo, Nian Liu, Xuguang Yang, Salman Khan, Rao Muhammad Anwer, Hisham Cholakkal, Fahad Shahbaz Khan, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

AI总结 TAViS通过文本桥接机制结合多模态基础模型与分割模型,实现高效的音频视觉分割与跨模态对齐。

Comments ICCV2025,code:https://github.com/Sssssuperior/TAViS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22826 2025-12-04 cs.CV 87%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17537 2025-09-24 cs.CV 87%

SimToken: A Simple Baseline for Referring Audio-Visual Segmentation

Dian Jin, Yanghao Zhou, Jinxing Zhou, Jiaqi Ma, Ruohao Guo, Dan Guo

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);MLLM(abstract);cross-modal(abstract)

Comments Project page: https://github.com/DianJin-HFUT/SimToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08294 2025-06-17 cs.CV 87%

FauForensics: Boosting Audio-Visual Deepfake Detection with Facial Action Units

Jian Wang, Baoyuan Wu, Li Liu, Qingshan Liu

机构 * School of Computer Science, Nanjing University of Posts and Telecommunications(南京邮电大学计算机科学学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06803 2025-05-13 cs.SD cs.CL cs.CV cs.MM eess.AS 87%

Bridging Ears and Eyes: Analyzing Audio and Visual Large Language Models to Humans in Visible Sound Recognition and Reducing Their Sensory Gap via Cross-Modal Distillation

Xilin Jiang, Junkai Wu, Vishal Choudhari, Nima Mesgarani

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10591 2024-06-18 eess.AS cs.AI cs.CV cs.MM cs.SD 87%

MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation

Ruibo Fu, Shuchen Shi, Hongming Guo, Tao Wang, Chunyu Qiang, Zhengqi Wen, Jianhua Tao, Xin Qi, Yi Lu, Xiaopeng Wang, Zhiyong Wang, Yukun Liu, Xuefei Liu, Shuai Zhang, Guanjun Li

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07451 2024-05-14 cs.CV 87%

CLIP-Powered TASS: Target-Aware Single-Stream Network for Audio-Visual Question Answering

Yuanyuan Jiang, Jianqin Yin

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);image-text(abstract)

Comments Submitted to the Journal on February 6, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07923 2026-08-11 cs.CV cs.MM cs.SD 新提交 87%

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

SCoPE:基于稀疏跨模态先验交换的无训练视听事件感知

Jaemo Jeong, Junho Yoon, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、cs.MM

AI总结 针对无训练视听事件感知的虚假共激活问题,提出SCoPE框架,通过跨模态标签竞争消除FCA,在LLP等数据集上显著提升性能且可直接迁移。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00837 2026-03-09 cs.SD cs.AI cs.MM 87%

A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives

从单模态、跨模态和多模态视角综述音乐生成

Shuyu Li, Shulei Ji, Zihao Wang, Songruoyao Wu, Jiaxing Yu, Kejun Zhang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(title);分类 cs.AI、cs.MM

AI总结 本文综述了多模态音乐生成的研究现状,探讨了多模态数据对齐、系统评估方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21797 2026-02-11 cs.LG cs.AI cs.SD eess.AS 87%

Quantifying Multimodal Imbalance: A GMM-Guided Adaptive Loss for Audio-Visual Learning

量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习

Zhaocheng Liu, Zhiwen Yu, Xiaoqing Liu

机构 * South China University of Technology(南方科技大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.AI、eess.AS

AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04635 2025-06-06 cs.CL cs.CV 87%

ViCocktail: Automated Multi-Modal Data Collection for Vietnamese Audio-Visual Speech Recognition

Thai-Binh Nguyen, Thi Van Nguyen, Quoc Truong Do, Chi Mai Luong

机构 * New Turing Institute(新图灵研究所) Phenikaa University(费尼卡大学) Vietnam Institute of Information Technology(越南信息技术研究所) VietAI Research(越南人工智能研究)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(title);分类 cs.CV、cs.CL

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00574 2025-02-05 cs.CV cs.MM 87%

EALD-MLLM: Emotion Analysis in Long-sequential and De-identity videos with Multi-modal Large Language Model

Deng Li, Xin Liu, Bohao Xing, Baiqiang Xia, Yuan Zong, Bihan Wen, Heikki Kälviäinen

专题命中 音频语音多模态 :multi-modal(title);MLLM(title);multimodal(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11938 2024-04-19 cs.MM cs.DC cs.SD eess.AS 87%

HyDiscGAN: A Hybrid Distributed cGAN for Audio-Visual Privacy Preservation in Multimodal Sentiment Analysis

Zhuojia Wu, Qi Zhang, Duoqian Miao, Kun Yi, Wei Fan, Liang Hu

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.MM、eess.AS

Comments 13 pages, IJCAI-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16620 2023-08-02 cs.SD cs.CV eess.AS 87%

Audio-Visual Segmentation by Exploring Cross-Modal Mutual Semantics

Chen Liu, Peike Li, Xingqun Qi, Hu Zhang, Lincheng Li, Dadong Wang, Xin Yu

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、eess.AS

Comments This paper has been received by ACM MM 23

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10180 2023-01-25 cs.CL cs.SD eess.AS 87%

A Multi-Purpose Audio-Visual Corpus for Multi-Modal Persian Speech Recognition: the Arman-AV Dataset

Javad Peymanfard, Samin Heydarian, Ali Lashini, Hossein Zeinali, Mohammad Reza Mohammadi, Nasser Mozayani

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(title);分类 cs.CL、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.05178 2022-03-11 cs.CV cs.SD eess.AS 87%

An Audio-Visual Attention Based Multimodal Network for Fake Talking Face Videos Detection

Ganglai Wang, Peng Zhang, Lei Xie, Wei Huang, Yufei Zha, Yanning Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(title);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.12136 2022-03-07 cs.CV cs.SD eess.AS eess.IV 87%

A Study of Multimodal Person Verification Using Audio-Visual-Thermal Data

Madina Abdrakhmanova, Saniya Abushakimova, Yerbolat Khassanov, Huseyin Atakan Varol

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 cs.CV、eess.AS

Comments 7 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.05890 2021-11-12 cs.CV cs.SD eess.AS 87%

Multimodal End-to-End Group Emotion Recognition using Cross-Modal Attention

Lev Evtodienko

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);分类 cs.CV、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.08001 2020-11-05 cs.CV cs.SD eess.AS 87%

Perfect match: Improved cross-modal embeddings for audio-visual synchronisation

Soo-Whan Chung, Joon Son Chung, Hong-Goo Kang

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title);分类 cs.CV、eess.AS

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07352 2020-07-15 eess.AS cs.SD eess.SP 87%

Audio-Visual Speech Separation and Dereverberation with a Two-Stage Multimodal Network

Ke Tan, Yong Xu, Shi-Xiong Zhang, Meng Yu, Dong Yu

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);分类 eess.AS;multi-modal(comments)

Comments 13 pages, accepted by IEEE JSTSP Special Issue on Deep Learning for Multi-modal Intelligence across Speech, Language, Vision, and Heterogeneous Signals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 87%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11178 2026-07-30 cs.AI cs.CL cs.MM cs.SI 版本更新 87%

TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech

TANDEM: 面向多模态仇恨言论的时间感知神经检测

Girish A. Koushik, Helen Treharne, Diptesh Kanojia

机构 * Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系) Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出TANDEM统一框架,通过串联强化学习策略联合优化视觉-语言和音频-语言模型,将音频-视觉仇恨检测转化为结构化推理问题,在HateMM上目标识别F1达0.73(提升30%),并保持精确时间定位。

Comments Accepted to AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 87%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07643 2026-06-09 cs.CV cs.AI cs.SD eess.AS 新提交 87%

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

AVI-Bench:迈向全模态大语言模型的人类级视听智能

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

机构 * Nanyang Technological University(南洋理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出AVI-Bench基准,通过感知、理解、推理三阶段跨模态任务评估全模态大语言模型的视听智能,并引入AVI-Bench-PriSe测试原始视听感知,揭示当前模型局限,构建四级AVI分类体系。

Comments 31 pages, 8 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25140 2026-03-27 cs.CV cs.AI cs.LG cs.MM cs.SD 87%

SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment

SAVe:利用视觉伪影和音视频不一致的自监督音频视觉深度伪造检测

Sahibzada Adil Shahzad, Ammarah Hashmi, Junichi Yamagishi, Yusuke Yasuda, Yu Tsao, Chia-Wen Lin, Yan-Tsung Peng, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所台湾国际研究生计划社交网络与人本计算项目) Department of Computer Science, National Chengchi University(国立政治大学资讯科学系) Institute of Information Systems and Applications, National Tsing Hua University(国立清华大学资讯系统与应用研究所) National Institute of Informatics(国立情报学研究所) Department of Electrical Engineering and the Institute of Communications Engineering, National Tsing Hua University(国立清华大学电机工程学系与通讯工程研究所) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心) Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SAVe通过自监督学习在真实视频上训练,生成伪篡改以学习互补的视觉线索,并通过音视频对齐组件捕捉跨模态证据,实现对深度伪造的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 87%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20296 2025-12-24 cs.CV cs.AI eess.AS eess.IV 87%

TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation

TAVID:基于文本的音频视觉交互对话生成

Ji-Hoon Kim, Junseok Ahn, Doyeop Kwak, Joon Son Chung, Shinji Watanabe

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 TAVID通过统一框架同步生成交互面部和对话语音,实现音频视觉多模态对话生成。

Comments Project page: https://mm.kaist.ac.kr/projects/TAVID

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02306 2025-12-03 cs.AI cs.CL cs.CR cs.CV cs.LG 87%

OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning

OmniGuard:统一的多模态防护机制与刻意推理

Boyu Zhu, Xiaofei Wen, Wenjie Jacky Mo, Tinghui Zhu, Yanan Xie, Peng Qi, Muhao Chen

机构 * Fudan University(复旦大学) University of California, Davis(加州大学戴维斯分校)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06862 2025-06-10 cs.RO cs.AI cs.CV cs.LG cs.SD eess.AS 87%

Multimodal Spatial Language Maps for Robot Navigation and Manipulation

Chenguang Huang, Oier Mees, Andy Zeng, Wolfram Burgard

机构 * University of Technology Nuremberg(图恩堡技术大学) UC Berkeley(伯克利大学) Google Research(谷歌研究)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI、eess.AS

Comments accepted to International Journal of Robotics Research (IJRR). 24 pages, 18 figures. The paper contains texts from VLMaps(arXiv:2210.05714) and AVLMaps(arXiv:2303.07522). The project page is https://mslmaps.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04038 2025-01-09 cs.MM cs.AI cs.SD eess.AS 87%

Listening and Seeing Again: Generative Error Correction for Audio-Visual Speech Recognition

Rui Liu, Hongyu Yuan, Haizhou Li

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.AI、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏