CodeMind: Evaluating Large Language Models for Code Reasoning
CodeMind: 评估大型语言模型的代码推理能力
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。