Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation
重新审视音频-语言预训练以学习通用音频表示
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Zhejiang University(浙江大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tencent AI Lab Seattle(腾讯AI实验室西雅图)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本文通过构建大规模数据集CaptionStew并系统对比对比学习和字幕生成目标,揭示了音频-语言预训练在数据效率和可扩展性上的权衡,为通用音频表示学习提供了实证指导。
Comments ACL 2026 Main. Code available at https://github.com/AudenAI/Auden