Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questions
使用未见过的随机变量问题对LLM的数学推理进行基准测试
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Beihang University(北京航空航天大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有数学基准的可靠性问题,提出RV-Bench方法,通过生成随机变量问题评估LLM的真实推理能力,发现模型在已见和未见数据分布上的能力不平衡,且推理泛化有限但可通过测试时扩展提升。
Comments Accepted to AAAI2026