Sema: Semantic Transport for Real-Time Multimodal Agents
Sema:面向实时多模态代理的语义传输
机构 * Pine AI
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Sema:面向实时多模态代理的语义传输
机构 * Pine AI
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
AI总结 Sema通过结合离散音频分词与混合屏幕表示及突发性分组传输,有效降低带宽并保持任务准确性,解决多模态代理传输中的语义保真问题。
重新审视基于内容的音乐推荐:从大规模音乐模型中高效地聚合特征
机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出TASTE数据集和基准框架,通过整合音频和文本信息提升音乐推荐性能,引入MuQ-token方法优化多层音频特征整合,验证了内容驱动方法的有效性。