arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-24 至 2026-04-24 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2604.20940 2026-04-24 cs.MM cs.NI cs.SD 79%

Sema: Semantic Transport for Real-Time Multimodal Agents

Sema:面向实时多模态代理的语义传输

Jiaying Meng, Bojie Li

机构 * Pine AI

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20847 2026-04-24 cs.IR cs.AI 57%

Revisiting Content-Based Music Recommendation: Efficient Feature Aggregation from Large-Scale Music Models

重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征

Yizhi Zhou, Jia-Qi Yang, De-Chuan Zhan, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏