Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT
时间盲:使用CHRONOSIGHT基准测试视觉语言模型的时间推理能力
机构 * Department of Computer Science, University of Missouri(密苏里大学计算机科学系) ; SAP
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出CHRONOSIGHT基准,从五个维度评估视觉语言模型的时间推理能力,发现模型与人类存在巨大差距(人类平均0.89,最佳模型0.40),并通过微调显著提升性能。