Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking
通过语义检索和时间重排实现多模态视频到音乐推荐
机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) ; Gaudio Lab, Inc(Gaudio实验室)
专题命中 视频多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM
AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。
Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026