arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2512.12772 2026-05-15 cs.MM cs.CV 84%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01015 2026-05-15 cs.CV 83%

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11042 2026-05-15 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation

V2M-Zero:零配对时间对齐视频到音乐生成

Yan-Bo Lin, Jonah Casebeer, Long Mai, Aniruddha Mahapatra, Gedas Bertasius, Nicholas J. Bryan

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 V2M-ZERO通过解耦的时间同步和语义控制生成与视频事件时间对齐的音乐,无需训练数据,实现更高质量的音频生成和语义对齐。

Comments Project page: https://genjib.github.io/v2m_zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21740 2026-05-15 cs.CL cs.AI 62%

A cross-species neural foundation model for end-to-end speech decoding

跨物种神经基础模型用于端到端语音解码

Yizi Zhang, Linyang He, Chaofei Fan, Tingkai Liu, Han Yu, Trung Le, Jingyuan Li, Scott Linderman, Lea Duncker, Francis R Willett, Nima Mesgarani, Liam Paninski

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Microsoft(微软公司) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出端到端BraIn-to-Text框架,通过单个可微神经网络将神经活动转化为连贯句子,利用跨任务、跨物种预训练神经编码器提升语音解码性能,降低词错误率至10.22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14731 2026-05-15 cs.GR cs.CV cs.SD 57%

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

UMo:统一稀疏运动建模用于实时协同语音化身

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Mogo AI Ltd.(Mogo AI有限公司) University of Southampton(南安普顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 UMo通过统一稀疏运动建模架构,结合文本、音频和运动令牌,实现高效实时密集重建,提升面部表情和手势的高保真动画生成,同时在低延迟条件下保持精细的语音-运动对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏