Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science(香港科学大学) ; The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) ; The University of Hong Kong Hong Kong China(香港大学香港中国)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.AI
AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。