Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters
迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程
机构 * Northeastern University(东北大学) ; San Francisco State University(旧金山州立大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI
AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。