arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-01 至 2026-05-01 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2509.23744 2026-05-01 cs.CL cs.AI 84%

Compose and Fuse: Revisiting the Foundational Bottlenecks in Multimodal Reasoning

组合与融合:重新审视多模态推理中的基础瓶颈

Yucheng Wang, Yifan Hou, Aydin Javadov, Mubashara Akhtar, Mrinmaya Sachan

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过逻辑基础评估框架,发现多模态推理中模态交互的六个模式影响推理效果,指出任务组合和融合是主要瓶颈,提出通过分步提示和早融控制提升推理性能。

Comments Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27866 2026-05-01 eess.AS cs.MM cs.SD 81%

LRS-VoxMM: A benchmark for in-the-wild audio-visual speech recognition

LRS-VoxMM:面向真实场景的音频视觉语音识别基准

Doyeop Kwak, Jeongsoo Choi, Suyeon Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 本文提出LRS-VoxMM基准,基于VoxMM数据集,通过预处理生成适合AVSR管道的样本,覆盖更广泛场景和声学条件,并提供噪声、回声和带宽限制的评估集,实验表明其比LRS3更难,视觉信息在音频退化时作用更显著。

Comments Technical report for the LRS-VoxMM dataset release. Project page: https://mm.kaist.ac.kr/projects/voxmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27517 2026-05-01 cs.HC 78%

I'm Fine, But My Voice Isn't: Cross-Modal Affective Dissonance Detection for Reflective Journaling

我很好,但我的声音不是:面向反思日记的跨模态情感不一致检测

Sumin Lee

专题命中 音频语音多模态 :cross-modal(title,abstract)

AI总结 本文提出跨模态情感不一致检测(CADD),通过区分掩蔽、应对和一致三种状态,解决数字日记中情感与语音不匹配的问题,并提出CADD-Journal数据集、DACM模型及领域差距量化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20522 2026-05-01 cs.SD cs.CV 57%

From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR

从图像到音乐语言:一种针对复杂多声部乐谱的两阶段结构解码方法

Nan Xu, Shiheng Li, Shengchao Hou

机构 * FindLab

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种实用的两阶段光学音乐识别管道新方法,聚焦第二阶段解码,通过结构解码问题解决复杂多声部乐谱中的声部分离和小节内时间同步问题。

Comments 52 pages, 18 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27436 2026-05-01 eess.AS eess.IV 57%

BUT System Description for CHiME-9 MCoRec Challenge

BUT系统描述用于CHiME-9 MCoRec挑战

Dominik Klement, Alexander Polok, Nguyen Hai Phong, Prachi Singh, Lukáš Burget

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出BUT系统,通过长上下文目标说话人音频视频ASR模型和LLM聚类方法,在CHiME-9 MCoRec任务中实现高精度语音识别与对话组划分。

Comments Accepted to HSCMA 2026 Workshop at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24587 2026-05-01 stat.AP 50%

Bayesian inference for hidden Markov models under genuine multimodality with application to ecological time series

隐马尔可夫模型下的贝叶斯推断在真实多模态情况下的应用及生态时间序列分析

Marco A. Gallegos-Herrada, Vianey Leos-Barajas, Jeffrey S. Rosenthal

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了在隐马尔可夫模型中处理多模态似然函数的挑战,提出改进的平行温度算法以有效探索高维多模态后验分布,并通过蓝鲸潜水数据验证了该方法在生态时间序列分析中的应用。

Comments 37 pages, 11 figures, to be submitted to Bayesian Analysis, corrected author affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏