Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
视觉语义熵:视觉语言模型能否识别视觉模糊性?
机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) ; Flinders University(弗林德斯大学)
专题命中 视觉问答 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对视觉语言模型在模糊输入下产生自信错误预测的问题,提出视觉语义熵(VSE),通过仅扰动图像并聚类生成答案的语义原型来量化不确定性,在五个模型和五个基准上达到最优。
Comments Accepted at ECCV2026