StatEval: A Comprehensive Benchmark for Large Language Models in Statistics
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。