Children's Intelligence Tests Pose Challenges for MLLMs? KidGym: A 2D Grid-Based Reasoning Benchmark for MLLMs
儿童智力测试对大语言模型构成挑战?KidGym:一种基于二维网格的推理基准测试用于大语言模型
机构 * ShanghaiTech University(上海科技大学)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出KidGym,一种基于二维网格的推理基准测试,用于评估大语言模型的执行、感知推理、学习、记忆和规划能力,通过12个独特任务测试模型适应性和发展潜力,揭示当前模型的局限性。
Comments Accepted at ICLR 2026