arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-05 至 2026-08-05 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 12 篇

2507.20720 2026-08-05 cs.HC 版本更新 85%

Beyond Text: Probing K-12 Educators' Perspectives and Ideas for Learning Opportunities Leveraging Multimodal Large Language Models

超越文本:探索K-12教育工作者对利用多模态大语言模型学习机会的视角和想法

Tiffany Tseng, Katelyn Lam, Tiffany Lin Fu, Alekhya Maram

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究通过工作坊探讨K-12教育工作者对多模态大语言模型在教育中的应用看法,分析其面临的挑战与需求,提出两种用户导向的实施方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 84%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 83%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 82%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03264 2026-08-05 cs.MM cs.CV cs.SD 新提交 81%

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

听而能视:面向视听实例分割的状态感知聆听

Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出 Hear to See(H2S)模型,通过 ASP 和 ADM 机制解决视听实例分割中重叠声源匹配与异步动态跟踪问题,在 AVISeg 数据集上实现 SOTA 性能,mAP 达 48.54,较此前方法提升 7.8%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06620 2026-08-05 eess.AS 版本更新 79%

Why Pre-trained Models Fail: Feature Entanglement in Multi-modal Depression Detection

预训练模型为何失效:多模态抑郁检测中的特征纠缠

Xiangyu Zhang, Beena Ahmed, Julien Epps

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 eess.AS

AI总结 本文针对预训练模型在多模态抑郁检测中性能差的问题,提出信息分离框架解纠缠混合特征,显著提升了SSL模型和LLMs的检测性能,为相关系统开发提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20918 2026-08-05 cs.AI 版本更新 70%

OPOD: On-Policy Omni Distillation

OPOD:基于策略的全模态蒸馏

Tong Zhao, Yuyang Hu, Yutao Zhu, Reed Li, Haijin Liang, Haibo Shi, Yu Lu, Zhicheng Dou

机构 * Tencent(腾讯)

专题命中 音频语音多模态 :multimodal(abstract);omni-modal(abstract);分类 cs.AI

AI总结 研究旨在提升全模态模型能力,提出基于策略的全模态蒸馏(OPOD)方法,将学生响应路由到对应模态教师,调整教师影响,训练后仅留可部署的全模态模型,在多基准测试和多种骨干网络规模下取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19192 2026-08-05 cs.DC 版本更新 67%

MUSE: A Heterogeneity-Aware Multimedia Search Engine for Mobile SoCs

AME:一种高效的异构代理记忆引擎用于智能手机

Xinkui Zhao, Qingyu Ma, Yifan Zhang, Hengxuan Lou, Sai Liu, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 AME是一种为智能手机设计的高效异构代理记忆引擎,通过硬件感知的矩阵流水线和调度方案提升内存处理效率,实现更高吞吐量和更低延迟。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03942 2026-08-05 cs.SD cs.CL cs.MM 版本更新 62%

MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models

MIDI-LLM:通过适配大语言模型改进文本到MIDI的音乐生成

Shih-Lun Wu, Dave Carlton, Ryan Miyakawa, Yoon Kim, Chris Donahue, Cheng-Zhi Anna Huang

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 该研究提出MIDI-LLM,通过适配Llama 3.2(1B)采用两阶段训练改进文本到MIDI生成,在用户研究中证实其在人机音乐协同创作中的有效性。

Comments Accepted to International Society for Music Information Retrieval (ISMIR) Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03742 2026-08-05 cs.SD cs.AI 新提交 57%

AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities

基于AI的音效生成:跨输入模态生成模型的叙事性综述

Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本章综述了跨文本、视觉等输入模态的AI音效生成模型,考察30篇文献,指出模型性能提升的同时存在时间同步局限等挑战,推动音效生成向自适应系统发展。

Comments 29 pages, 5 figures, to appear in G. A. Tsihrintzis, M. Virvou, N. Bourbakis, and L. C. Jain (Eds.), Advances in Global Applied Artificial Intelligence: Springer, Learning and Analytics in Intelligent Systems Book Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03040 2026-08-05 cs.SD 新提交 50%

Calliphony: A Calligraphy-Driven Interface for Real-Time Generative Music Performance

Calliphony:一种用于实时生成式音乐表演的书法驱动界面

Tristan Wu, Ruiji Yu, Gus Xia

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究提出书法驱动的实时生成式音乐表演界面Calliphony,构建低延迟流水线捕捉毛笔运动映射为控制信号,实现多轨MIDI生成,将书法扩展为视听AI辅助表演场景,为现场音乐表演提供新方式。

Comments 6 pages, 4 figures. Published in the Proceedings of the International Conference on New Interfaces for Musical Expression (NIME 2026). The first two authors contributed equally

Journal ref Proceedings of the International Conference on New Interfaces for Musical Expression (NIME 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01920 2026-08-05 cs.SD 版本更新 50%

P-MUSE: Prompt-MIDI-Optional Model for Unified Instrumental Music Synthesis and Editing

P-MUSE:用于统一器乐合成与编辑的提示-MIDI可选模型

Chong Jing, Junan Zhang, Jing Yang, Yulun Wu, Fan Fan, Zhizheng Wu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 P-MUSE是统一器乐合成与编辑的MIDI-to-Music框架,通过多阶段课程学习整合两种生成范式,提出相位感知引导策略与尾端丢弃法,并建立含四类乐器的综合基准。

详情

展开后加载摘要…

URL PDF HTML 收藏