How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures
视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估
机构 * University of Aberdeen(阿伯丁大学) ; International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) ; University of Technology Nuremberg(纽伦堡工业大学) ; University of Southern California(南加利福尼亚大学)
AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。
Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com