arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2604.07741 2026-04-10 cs.CV cs.MM 86%

MSCT: Differential Cross-Modal Attention for Deepfake Detection

MSCT:深度伪造检测中的差分跨模态注意力

Fangda Wei, Miao Liu, Yingxue Wang, Jing Wang, Shenghui Zhao, Nan Li

机构 * Beijing Institute of Technology(北京理工大学) China Academy of Electronics and Information Technology(中国电子信息技术研究院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MSCT模型,通过多尺度自注意力和差分跨模态注意力提升深度伪造检测性能,实验验证其在FakeAVCeleb数据集上的有效性。

Comments Accpeted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08209 2026-04-10 cs.CV 85%

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering

OmniJigsaw:通过模态协调重排序增强多模态推理

Yiduo Jia, Muzhi Zhu, Hao Zhong, Mingyu Liu, Yuling Xi, Hao Chen, Bin Qin, Yongjie Yang, Zhenbo Luo, Chunhua Shen

机构 * Zhejiang University(浙江大学) Xiaomi Inc.(小米公司)

专题命中 音频语音多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 OmniJigsaw通过模态协调重排序任务提升多模态推理能力,采用三重策略实现跨模态整合,并通过两级数据过滤提升模型适应性,验证了其在多模态自监督学习中的有效性。

Comments Project page: https://aim-uofa.github.io/OmniJigsaw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08147 2026-04-10 cs.SD cs.CV 85%

Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

通过教师引导的双路径实现语义噪声削减

Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Objecteye Inc.(北京眼神科技有限公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TG-DP框架,通过分离重建与对齐路径,减少语义噪声,提升音频视频表示学习效果,实现零样本检索性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07859 2026-04-10 eess.SP 82%

Object-Attribute-Relation Model Driven Adaptive Hierarchical Transmission for Multimodal Semantic Communication

基于对象-属性-关系模型的自适应分层传输机制用于多模态语义通信

Chenxing Li, Yiping Duan, Han Jiao, Xiaoming Tao, Weiyao Lin, Mingquan Lu

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于自适应对象-属性-关系层次的多模态语义通信框架,通过融合视觉、文本和音频流构建决策导向拓扑图,在低带宽下实现90%的带宽节省和10倍的带宽减少,同时消除深度衰减信道中的悬崖效应。

Comments 13 pages,7 figures, 6 tables,56 reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08359 2026-04-10 eess.AS 79%

Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework

跟踪听者注意力:基于注视的音频视觉语音增强框架

Hsiang-Cheng Yang, You-Jin Li, Rong Chao, Yu Tsao, Borching Su, Shao-Yi Chien

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出基于注视的音频视觉语音增强框架,通过结合注视方向与面部检测提取目标说话人特征,提升多说话人环境中的语音增强效果。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 79%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-04-10 eess.SP cs.SD 78%

An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

Journal ref IEEE Transactions on Neural Networks and Learning Systems,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08384 2026-04-10 eess.AS cs.AI 62%

TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs

TASU2:用于语音大语言模型对齐和低资源适应的可控CTC模拟

Jing Peng, Chenghao Wang, Yi Yang, Lirong Qian, Junjie Li, Yu Xi, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(教育部人工智能重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(思必驰科技股份有限公司) Nanjing University(南京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 TASU2通过可控CTC模拟生成文本监督,提升语音大语言模型的对齐和低资源适应性能,优于TASU和文本细调等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07895 2026-04-10 cs.AI 57%

DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues

DialBGM:从日常多轮对话中推荐背景音乐的基准测试

Joonhyeok Shin, Jaehoon Kang, Yujun Lee, Hannah Lee, Yejin Lee, Yoonji Park, Kyuhong Shim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DialBGM基准测试,通过1200个日常对话数据,评估模型在无音乐描述的多轮对话中推荐非侵入性背景音乐的能力,发现现有模型在Hit@1指标上远低于人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07467 2026-04-10 cs.CL cs.LG 57%

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

词调难以量化:探究 Mandarin 和 Yorùbá 中的离散语音单元

Opeyemi Osakuade, Simon King

机构 * The Centre for Speech Technology Research, University of Edinburgh, UK(英国爱丁堡大学语音技术研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究发现离散语音单元在编码超段落信息时可靠性较低,尤其在词调方面,提出通过两次聚类方法改进词调编码。

Comments Accepted at Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08363 2026-04-10 cs.SD 50%

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

CapTalk:单语句和对话语音生成的统一语音设计

Xiaosu Su, Zihan Sun, Peilei Jia, Jun Gao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hello Group Inc.

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CapTalk提出一种统一的文本-音频自回归框架,实现单语句和对话语音设计,通过分层变分条件模块平衡语音稳定性和上下文适应性,提升表达可控性和上下文恰当性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏