arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-06 至 2026-04-06 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2604.02391 2026-04-06 cs.SD cs.AI eess.AS 84%

Reliability-Aware Geometric Fusion for Robust Audio-Visual Navigation

可靠性感知的几何融合用于鲁棒的音频视觉导航

Teng Liu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出RAVN框架,通过音频衍生的可靠性线索条件跨模态融合,动态校准音频和视觉输入的整合,引入Acoustic Geometry Reasoner和Reliability-Aware Geometric Modulation,提升复杂环境下的导航性能。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02389 2026-04-06 cs.SD cs.AI eess.AS 84%

Audio Spatially-Guided Fusion for Audio-Visual Navigation

音频空间引导融合用于音频视觉导航

Xinyu Zhou, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合研究实验室,具身智能) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出一种音频空间引导融合方法,通过自适应提取空间状态信息,实现多模态特征动态对齐与融合,提升在未知声源分布下的导航泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02605 2026-04-06 cs.AI cs.SD 83%

Do Audio-Visual Large Language Models Really See and Hear?

音频视觉大语言模型真的能看见和听见吗?

Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。

Comments CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02390 2026-04-06 cs.SD cs.AI eess.AS 81%

Spatial-Aware Conditioned Fusion for Audio-Visual Navigation

空间感知条件融合用于音视频导航

Shaohang Wu, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语种认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出空间感知条件融合(SACF),通过离散化目标相对方向和距离,生成紧凑描述符以指导策略和状态建模,利用音频嵌入和空间描述符生成通道级缩放和偏置,调节视觉特征以生成目标导向的融合表示,提升导航效率和泛化能力。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏