Unlocking Spatial Grounding in Large Audio-Visual Retrieval models
在大型视听检索模型中解锁空间定位
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 研究针对视听声源定位任务,利用大规模视听检索模型的潜在表示,引入LAIP框架,通过音频信息池化恢复局部空间信息,在相关数据集上取得领先性能,证明可从现有检索表示解锁定位,为检索和定位任务提供统一路径。