ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试
机构 * University of Cambridge(剑桥大学) ; University of Alberta(阿尔伯塔大学) ; The University of Hong Kong(香港大学) ; University of Oxford(牛津大学) ; Northeastern University(东北大学) ; Astadeus ; College of Southern Maryland(马里兰州南部学院) ; University of Geneva(日内瓦大学) ; University of Oregon(俄勒冈大学)
AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。
Comments Accepted at ICML 2026