Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models
大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)
专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL
AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。
Comments Accepted to ACL 2026 Findings