LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening
LLMEval-Logic: 一个验证求解器的中文逻辑推理基准,具有对抗性强化
机构 * Institute of Trustworthy Embodied Artificial Intelligence(可信具身人工智能研究院) ; Fudan University(复旦大学) ; Hunyuan Team Tencent(腾讯 Hunyuan 团队) ; School of Philosophy Fudan University(复旦大学哲学学院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL
AI总结 本文提出LLMEval-Logic,一个基于真实情境场景的中文逻辑推理基准,通过作者和专家共同审核自然语言项目及其形式化参考,利用Z3验证注释答案,构建自然到形式的评分标准,并通过闭环对抗流程强化选定项目。基准包含246个基础项目和190个难度项目,评估14个前沿LLM显示当前模型存在显著差距。