ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?
ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?
机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) ; Peng Cheng Laboratory(鹏城实验室) ; Rabbitpre Intelligence ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。