arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 14 篇

2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 85%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08618 2026-04-28 eess.AS cs.CV cs.SD 84%

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models

VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别

Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);分类 cs.CV、eess.AS

AI总结 VAPO通过多目标强化学习优化多模态大语言模型,解决视觉干扰问题,提升幻灯片增强语音识别的准确率和领域专用实体识别性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24191 2026-04-28 cs.CV 83%

Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

Omni-o3:深度嵌套多模态推理用于 deliberative 音视频推理

Zhicheng Zhang, Wentao Gu, Weicheng Wang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Jufeng Yang

机构 * Nankai University(南开大学) Pengcheng Laboratory(鹏城实验室) Kuaishou Technology(快手科技) Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田))

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-o3通过深度嵌套推理策略,解决多模态交互中搜索空间大且冗余的问题,提升音视频推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23692 2026-04-28 cs.GR cs.CV 79%

Personalizing Causal Audio-Driven Facial Motion via Dynamic Multi-modal Retrieval

通过动态多模态检索个性化因果音频驱动面部运动

Xuangeng Chu, Yu Han, Wei Mao, Shih-En Wei

机构 * The University of Tokyo, Codec Avatars Lab, Meta(东京大学,Codec Avatars实验室,Meta) Codec Avatars Lab, Meta(Codec Avatars实验室,Meta)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种端到端的因果框架,通过动态多模态风格检索实现个性化因果面部运动生成,解决实时流媒体与高保真个性化之间的矛盾,提升低延迟并利用无结构风格参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23860 2026-04-28 cs.CV cs.AI 73%

Exploring Audio Hallucination in Egocentric Video Understanding

探索第一人称视频理解中的音频幻觉

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai

机构 * Meta University Of Maryland, College Park(马里兰大学学院公园分校)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了第一人称视频中音频幻觉问题,提出自动评估框架和分类体系,发现先进AV-LLMs在回答声音相关问题时存在较高幻觉率。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23935 2026-04-28 cs.CV 70%

2nd of the 5th PVUW MeViS-Audio Track: ASR-SaSaSa2VA

第五届PVUW MeViS-Audio Track的第二名:ASR-SaSaSa2VA

Zhiyu Wang, Xudong Kang, Shutao Li

机构 * Hunan University(湖南大学)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ASR-SaSaSa2VA框架,通过ASR将音频转换为文本描述,结合预训练文本引导视频分割模型实现高效的音频引导视频分割,解决了计算复杂度高、对齐困难和数据依赖性强的问题。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 67%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23632 2026-04-28 cs.CV cs.MM cs.SD 62%

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏

Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Baidu(百度)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23284 2026-04-28 cs.CL cs.AI 62%

Au-M-ol: A Unified Model for Medical Audio and Language Understanding

Au-M-ol:医疗音频与语言理解的统一模型

Meizhu Liu, Nistha Mitra, Paul Li, Amine Abdaoui, Adam Ledyard, Tao Sheng

机构 * Oracle AI Science(Oracle AI科学) Neuramill

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Au-M-ol模型,通过整合音频处理与大语言模型,提升医疗语音识别等任务的性能,实验显示其将词错误率降低56%,在噪声和专业术语等挑战下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22817 2026-04-28 eess.AS cs.CL cs.LG cs.SD 62%

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

In-Sync: 语音感知大语言模型在ASR中的适应性改进:基于词级时间戳预测

Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出通过词级时间戳预测提升ASR性能,采用轻量训练策略增强对齐鲁棒性,实验证明在多个数据集上提升了时间戳准确性和整体ASR表现。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 57%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23717 2026-04-28 cs.SD cs.CL 57%

HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models

HeadRouter: 任务自适应音频标记压缩中的动态头部权重路由

Peize He, Yaodi Luo, Xiaoqian Liu, Xuyang Liu, Jiahang Deng, Yaosong Du, Bangyu Li, Xiyan Gui, Yuxuan Chen, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) DAIL Tech(DAIL科技) Northeastern University(东北大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL

AI总结 HeadRouter通过动态评估不同音频任务中注意力头的重要性,实现高效的音频标记压缩,实验表明其在多个基准上均取得最佳压缩效果。

Comments Homepage: https://dabdans.github.io/HeadRouter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00626 2026-04-28 cs.SD cs.CL 57%

When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models

沉默也重要:无关音频对大音频-语言模型文本推理的影响

Chen-An Li, Tzu-Han Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(国立成功大学人工智能研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 研究探讨无关音频对大音频-语言模型文本推理的影响,发现非信息性音频会降低准确率并增加预测波动,提出自一致性策略能提升稳定性但增加计算成本。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23077 2026-04-28 cs.IR 50%

Adopting State-of-the-Art Pretrained Audio Representations for Music Recommender Systems

采用最新预训练音频表示用于音乐推荐系统

Yan-Martin Tamm, Anna Aljanaki

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文评估了九种预训练模型在音乐推荐系统中的表现,发现其在传统MIR任务与冷热启动场景中性能差异显著,揭示了后端模型捕捉的音乐信息方面存在差异。

Comments Extended version of arXiv:2409.08987. Accepted for publication in the Special Issue "Highlights of RecSys '24" in ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏