arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-11 至 2026-08-11 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 17 篇

2511.23304 2026-08-11 cs.AI 版本更新 89%

Multi-Modal Scene Graph with Kolmogorov-Arnold Experts for Audio-Visual Question Answering

多模态场景图与科莫戈罗夫-阿诺尔德专家网络用于音频-视觉问答

Zijian Fu, Changsheng Lv, Xianlin Zhang, Mengshi Qi, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于多模态场景图与科莫戈罗夫-阿诺尔德专家网络的SHRIKE模型,用于提升音频-视觉问答任务中的跨模态交互建模与时间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07923 2026-08-11 cs.CV cs.MM cs.SD 新提交 87%

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

SCoPE:基于稀疏跨模态先验交换的无训练视听事件感知

Jaemo Jeong, Junho Yoon, Hyunju Kim, Dongman Lee

机构 * KAIST(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(title);分类 cs.CV、cs.MM

AI总结 针对无训练视听事件感知的虚假共激活问题,提出SCoPE框架,通过跨模态标签竞争消除FCA,在LLP等数据集上显著提升性能且可直接迁移。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 86%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08794 2026-08-11 cs.AI cs.MM cs.SD 新提交 86%

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

面向全模态大语言模型(Omni-LLMs)的基于局部视听动态的延迟音频剪枝方法

Kyeongyoon Lee, Hongyeob Kim, Youngeun Kim, Sungeun Hong

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);omni-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对全模态大语言模型的高开销问题,提出两阶段框架A-PACK,利用局部视听动态延迟音频剪枝,在Qwen2.5-Omni基准上实现性能最优,同时大幅降低预填充开销并提升解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00959 2026-08-11 cs.AI 版本更新 85%

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

通过部分信息分解理解多模态语言模型中的模态交互

Wanlong Fang, Tianle Zhang, Wen Tao, Alvin Chan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.AI

AI总结 引入部分信息分解(PID)框架,分离感官和语言输入的独特、冗余和协同贡献,揭示多模态大模型中的模态使用模式,并扩展至三模态系统。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23957 2026-08-11 cs.CV 版本更新 85%

LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization

LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位

Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) UNSW Sydney(新南威尔士大学悉尼分校) School of Information and Communication Technology(信息与通信技术学院) Griffith University(格里菲斯大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08147 2026-08-11 cs.MM 新提交 83%

SAMOT: State-Aware Step Modulation and Optimal Transport Matching for Audio-Visual Instance Segmentation

SAMOT:面向视听实例分割的状态感知步长调制与最优传输匹配

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 针对AVIS的模态状态变化干扰与跨模态分布差异问题,提出含ADSM与OT-MM的SAMOT框架,在AVIS基准取得最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09475 2026-08-11 cs.CV 新提交 79%

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

基于一致性的视听分割:第八届LSVOS挑战赛MeViS音频赛道冠军报告

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

机构 * National 111 Project Base of Intelligent Information Processing(智能信息处理国家111计划基地)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文针对第八届LSVOS挑战赛MeViS音频赛道,提出分阶段视听分割方案,以Qwen3-ASR为基础,通过掩码一致性选择轨迹并修正查询,结合多模态得分判断目标存在性,最终取得赛道第一的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09288 2026-08-11 cs.SD cs.AI 新提交 79%

DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation

DAVE:用于真实场景语音分离的解耦式视听增强框架

Wei Zhou, Wanyi Ning, Yinshang Guo, Qianxiao Fang, Haitao Qian, Yingpeng Li

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI

AI总结 本文提出用于真实场景语音分离的解耦式视听增强框架DAVE,构建含219411个混合样本的DAVE-Corpus,采用渐进式多目标优化与选择性增强链,在挑战赛中展现出良好鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08510 2026-08-11 cs.CL 新提交 79%

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

从语音到交互:鸡尾酒会场景下多模态系统的分析

Thai-Binh Nguyen, Zhaolin Li, Jan Niehues, Alexander Waibel

专题命中 音频语音多模态 :multimodal(title);audio-visual(abstract);分类 cs.CL

AI总结 本研究分析了CHiME-9 MCoRec任务中不同多模态系统解决鸡尾酒会场景的策略,发现最优系统实现57%相对错误减少,且高语音重叠并非性能差异的主要原因。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07487 2026-08-11 cs.HC cs.CY 新提交 78%

SafeStudent Driving: A Multimodal Driver-Safety System to Support Teen Drivers Using Computer Vision and Mobile Sensing

SafeStudent驾驶:一种基于计算机视觉与移动感知的多模态驾驶员安全系统,用于支持青少年驾驶员

Max Liu, Yu Sun

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 该研究开发了一种部署在 Raspberry Pi 和 Flutter 移动应用上的 SafeStudent Driving 多模态系统,通过计算机视觉与移动感知技术辅助青少年驾驶员,实验验证了其有效性,为新手驾驶员安全习惯养成提供了低成本方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09765 2026-08-11 cs.CL cs.CV 新提交 73%

REFRAMED: Towards Realistic Audio Description Generation for Movies

REFRAMED:面向电影的真实音频描述生成

Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

专题命中 音频语音多模态 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 本文提出新的音频描述生成范式,构建含206部电影的REFRAMED数据集及评估协议,实验显示现有AD系统和多模态LLMs表现优于简单基线但不及专业人类,为视频理解研究提供新基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08366 2026-08-11 cs.CV q-bio.GN 新提交 70%

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

VOICE:一种融合原位单细胞基因表达直接预测与基于检索预测的视觉-组学基础模型

Xin Luo, Yicheng Tao, Haoxuan Zeng, Suyuan Wang, Chenzi Ouyang, Meiqi Zhu, Kai Liu, Shuibing Chen, Jie Liu

机构 * University of Michigan(密歇根大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 音频语音多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 该研究提出多模态基础模型 VOICE,通过对比学习对齐 H&E 形态与单细胞表达嵌入,融合直接回归与参考检索分支,泛化性良好且在七项指标上优于现有方法,可从 H&E 图像预测单细胞基因表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08990 2026-08-11 cs.HC cs.MM 新提交 57%

AI-Guided Learning: Research on Knowledge and Skill Acquisition Support Methods Using Deep Learning Audio-Video Processing Techniques

AI引导式学习:基于深度学习音视频处理技术的知识与技能获取支持方法研究

Kazuki Kawamura

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本研究提出含三个系统的AI引导式学习框架,通过深度学习音视频处理技术,解决学习中长内容耗时、技能模仿反馈不足的问题,相关系统在播放效率、视频时长缩减、发音提升上均有良好效果。

Comments 118 pages, 26 figures, 4 tables. Doctoral dissertation, Doctor of Interdisciplinary Informatics, The University of Tokyo; degree awarded September 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22790 2026-08-11 cs.SD cs.AI 版本更新 57%

Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior

高效扩展音频模型:计算约束与优化行为的联合研究

Vyom Agarwal, Mokshda Gangrade, Siddharth Pal, Jerry Wu

机构 * University of Maryland(马里兰大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对ASR和SER任务,提出统一框架分析模型大小、输入长度和表示分辨率三个计算维度,在固定预算下优化资源分配,发现非线性缩放行为并确定最优操作点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05550 2026-08-11 cs.SD cs.CL cs.LG 版本更新 57%

Assessing Factual Music Comprehension in Large Audio Language Models

评估大型音频语言模型中的事实音乐理解能力

Daniel Chenyu Lin, Michael Freeman, John Thickstun

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有MusicQA数据集无法衡量模型回答事实正确性的问题,提出基于可验证信息的评估协议,通过精确率、召回率和F1分数客观评估模型,并在三个数据集上定义六项事实检索任务,对九个最新LALM进行基准测试。

Comments 17 pages; ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏