Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation
视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估
机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);visual question answering(abstract);分类 cs.AI
AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。
Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally