Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning
生成、分析与优化:基于MLLM元推理的无训练声源定位
机构 * Kyung Hee University(庆熙大学)
专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。
Comments Accepted to CVPR 2026