GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games
GVGAI-LLM:通过无限游戏评估大语言模型代理
机构 * New York University(纽约大学) ; University of the Witwatersrand(沃尔特·斯通大学) ; Meta ; Lingnan University(岭南大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。