Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary
棋盘上的幻觉:工具增强型大语言模型(LLM)象棋评论评估
机构 * Princeton University(普林斯顿大学) ; Sentient Labs ; University of Washington(华盛顿大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出ACT-Eval框架,评估工具增强型LLM的象棋评论,发现事实幻觉普遍存在,工具可提升事实正确性但战略战术覆盖度仍有限。
Comments 23 pages, 6 figures