SceneBind: Binding What and Where Across Vision, Audio and Language
SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”
机构 * University of Washington(华盛顿大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Hankuk University of Foreign Studies(韩国外国语大学)
专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。
Comments Project website: https://scenebind.github.io/