AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration
AuditoryHuM: 利用人机协同生成和聚类听觉场景标签
机构 * Australian Hearing Hub, Macquarie University, Sydney, Australia(澳大利亚听力中心、麦觉里大学、悉尼、澳大利亚) ; Google Research Australia, Sydney, Australia(谷歌澳大利亚研究、悉尼、澳大利亚)
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract)
AI总结 AuditoryHuM通过人机协同方法实现听觉场景标签的自动生成与聚类,提供了一种高效且低成本的标准化分类解决方案,适用于边缘设备部署。