Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets
计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Intel Labs(英特尔实验室) ; Capital One AI Labs(Capital One AI实验室)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。