LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics
LemmaBench: 一个用于评估LLM在数学领域能力的实时研究级基准
机构 * Korean Institute for Advanced Study(韩国高级研究院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一个自动从arXiv提取引理并重写为自包含陈述的基准,直接评估LLM在最新数学研究上的表现,当前模型定理证明准确率仅10-15%。
Comments Accepted at the 3rd AI for Math Workshop (AI4Math) at ICML 2026 (poster). Non-archival workshop. 15 pages, 3 figures, 5 Tables