Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources
动态声源的时空音频语言建模
机构 * POSTECH(浦项科技大学) ; Sony AI(索尼AI) ; Sony Group Corporation(索尼集团) ; Sungkyunkwan University(成均馆大学) ; KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ST-AudioLM模型,通过时空音频编码器联合学习事件语义与源轨迹,在ST-AudioQA基准上提升动态声源问答的语义-定位权衡。