VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation
VLM评判者能排序但无法评分:多模态评估中的任务依赖性不确定性
机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) ; AI Labs at Capital One(Capital One人工智能实验室)
专题命中 幻觉与鲁棒性 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文通过置信预测框架分析VLM作为评判者的可靠性,发现任务依赖性显著影响评估不确定性,提出排名-评分解耦问题,揭示任务难度和标注质量对区间宽度的影响。