arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3222 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3222 篇

2507.22069 2026-08-04 cs.PL cs.AI 57%

A Compute-Matched Re-Evaluation of TroVE on MATH

Tobias Sesterhenn, Ian Berlot-Attwell, Janis Zenkner, Christian Bartelt

机构 * Clausthal University of Technology, Clausthal, Germany(克莱斯特哈尔技术大学) Vector Institute, University of Toronto, Toronto, Canada(向量研究所)

专题命中 数学推理 :self-correction(abstract);分类 cs.AI

Journal ref 2nd AI for Math Workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 57%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 57%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18622 2026-08-03 cs.CR cs.AI 版本更新 57%

CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization

CPInj:揭示文本协作式提示优化中的提示注入风险

Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) McMaster University(麦斯特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究文本协作式提示优化(TCPO)中提示注入风险,提出协作式提示注入攻击CPInj,用恶意指令污染全局提示,降低下游任务性能,现有防御方法无效;还提出防御导向聚合方法APAgg,实验表明TCPO存在关键漏洞,攻击有待更强大防御。

Comments Accepted by COLM 2026 and AI4GOOD workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28582 2026-07-31 cs.LG 新提交 57%

$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation

β-OPSD:基于策略优化推导,采用自蒸馏训练

Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang

机构 * University of Maryland(马里兰大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 β-OPSD是将普通OPSD扩展为含可控正则化参数β的策略优化通用形式,通过蒸馏近似策略优化解,在数学推理基准上性能与稳定性均优于普通OPSD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28077 2026-07-31 cs.CL 新提交 57%

LEEPS: Latent-Guided Explore-Exploit Prompt Sampling for Efficient RLVR in Large Language Models

LEEPS:用于大语言模型中高效RLVR的潜在引导探索-利用提示采样

Shuang Liang, Haoyang Zhou, Yifan Gong, Guowei Wang, Xiting Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LEEPS是一种潜在引导探索-利用提示采样器,通过自适应分配rollout预算等方式优化提示采样,在6个数学推理基准和3个OOD通用推理基准上均取得最优性能,且训练开销较小。

Comments 15pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27994 2026-07-31 cs.AI 新提交 57%

SKIMIX: Multi-Agent Harness-Time Scaling with Skill Mixture for Dynamic Harness Engineering

SKIMIX:面向动态 harness 工程的技能混合多智能体 harness 时间缩放方法

Jia Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SKIMIX 是一种多智能体框架,结合技能检索、抗稀释路由等技术,在六个推理基准上提升开放式数学推理能力,为可扩展智能体设计提供了任务特性相关的实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27709 2026-07-31 cs.AI 新提交 57%

MECA: A Mechanism-Centered Agent for Constructing Well-Specified and Valuable Mathematical Conjectures

MECA:一种以机制为中心的智能体,用于构建定义明确且有价值的数学猜想

Wentao Long, Yunfei Zhang, Chenyi Li, Zaiwen Wen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 MECA是一种以机制为中心的多智能体框架,可联合构建候选数学命题及其支撑机制,能生成定义明确且有研究价值的猜想,相关猜想对现有自动证明器仍具挑战性。

Comments 78 pages, 5 figures. Includes appendices and the full collection of 100 generated conjectures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16140 2026-07-31 cs.LG 版本更新 57%

Noisy Data is Destructive to Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习中噪声数据是破坏性的

Yuxuan Zhu, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24847 2026-07-30 math.NT cs.AI math.GR 版本更新 57%

Extremal Chowla sets and their linear analogues: A human-AI mathematical investigation using Co-Scientist

极值乔拉集及其线性类似物:使用联合科学家进行的人机数学研究

Mohsen Aliabadi, Keith Driscoll, Elliot Krop, Petar Sirkovic, Everett Sullivan, Elahe Vedadi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究有限群和有限域扩张中与乔拉型序条件相关的极值不变量,通过专家指导的人机合作,利用联合科学家探索示例与策略,得出循环群、有限阿贝尔群及有限域扩张相关公式及结论。

Comments Minor typos have been corrected. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00045 2026-07-28 cs.AI cs.ET quant-ph 版本更新 57%

Universal Quantum Transformer

通用量子Transformer

Sungyong Chung, Alireza Talebpour

机构 * Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院土木与环境工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 提出通用量子Transformer(UQT),利用多量子比特系统的物理特性作为归纳偏置,通过参数化几何相位嵌入和SU(2)波干涉实现精确的数学和代数推理,在紧凑的5量子比特基板上完美学习循环模算术和非阿贝尔代数,并实现确定性泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21946 2026-07-27 cs.LG 新提交 57%

Multi-Agent Debate and Visual Information Extraction for SeePhys Pro: A 1st-Place Technical Report from ICML 2026 AI4Math Track 3 Challenge

用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告

Jiseok Kwak, Suhyeon Jo, Taewoo Kim, Yeongmin Kim, Byeonghu Na, Il-chul Moon

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 57%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20764 2026-07-24 cs.AI 新提交 57%

ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management

ArbiGraph:用于评估上下文管理的任意可扩展可验证任务图

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ArbiGraph作为基准生成器,将任务表示为带Python求解器的自然语言问题,通过类型化中间状态组合任务。用多种任务类别实例化并评估智能体,发现其在孤立任务和复杂相关任务上表现不同,揭示了单任务评估无法发现的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18672 2026-07-24 cs.LG stat.ML 版本更新 57%

Concept Concentration for Faithful Representation Intervention

用于忠实表示干预的概念集中化

Hongzheng Yang, Yongqiang Chen, Zeyu Qin, Tongliang Liu, Chaowei Xiao, Kun Zhang, Bo Han

机构 * SAIC Centre, USYD(SAIC中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 研究大语言模型表示干预中定位忠实概念的问题,提出概念集中化(COCA)方法,通过重构训练数据简化决策边界,有效降低分布内和分布外越狱成功率,且在常规任务上保持性能。

Comments ICML'26; Hongzheng and Yongqiang contributed equally; project page: https://causalcoat.github.io/coca

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20327 2026-07-23 cs.CL 新提交 57%

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

PyroDash:具有成本效益的令牌级小语言模型与大语言模型协作推理

Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia, Jianyao Ma, Yicheng Ding

机构 * Pyromind Dynamics Inc.(Pyromind动力学公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型推理成本高、小语言模型可靠性低的问题,提出PyroDash框架,通过令牌级协作推理,分三阶段训练小语言模型,在数学推理基准测试中能支持不同操作点,可减少大语言模型使用并保持推理性能。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18260 2026-07-22 cs.AI 新提交 57%

FindStatBench: Evaluating Large Language Models on Combinatorial Code Synthesis

FindStatBench:在组合代码合成上评估大语言模型

Soham Dan

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍用于评估大语言模型组合代码合成能力的FindStatBench基准,涵盖多种合成任务,通过特定方式评分并评估11个系统,发现开源闭源系统准确率趋同、示例可能有害、存在输出预算问题等,揭示统计合成与映射合成的差异及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 57%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16704 2026-07-21 cs.CL 新提交 57%

Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation

尽管语言模型在努力时会出错:用于自我纠正科学生成的共形预测

Mingqiao Mo, Yunlong Tan, Hao Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型生成技术内容常违反科学原理的问题,提出图结构共形预测框架SFC,将科学推理分解为单元,考虑逻辑依赖,通过实时验证和动态分支纠错,在多基准测试中表现出色,提升准确率、有效性并减少定律违反。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16209 2026-07-21 cs.AI 新提交 57%

Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning

Shapley上下文剪枝:一种用于上下文重排和剪枝的合作博弈视角

Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对检索增强生成系统上下文重排和剪枝缺乏可解释统一框架的问题,提出Shapley上下文剪枝框架,用合作博弈视角归因重要性,采用深度集架构和蒙特卡罗采样,经多实验验证,模型在下游问答性能上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16206 2026-07-21 cs.AI 新提交 57%

PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架

Yujie Shen, Haowen Chen

机构 * School of Mathematics, Hunan University(湖南大学数学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交 57%

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15841 2026-07-21 cs.AI 版本更新 57%

Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains

预算受限LLM验证中的异方差信号:结构异质性限制了优化收益

Jinlong Yang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文发现LLM不确定性信号在预算受限验证中存在异方差性,导致全局分配扭曲;通过分层阈值干预(CST)在强异质性设置下提升命中率达17个百分点,揭示结构异质性是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 57%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14628 2026-07-17 cs.CL cs.CR 新提交 57%

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

路由上限与领域无关:代码安全漏洞检测中的结构先验注入

Manuel Israel Cázares

机构 * Bytepro AI(字节专业人工智能公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究在代码安全漏洞检测中测试路由器假设是否跨领域,通过重现SAIR设计评估三个大语言模型。结果表明结构先验能提升语义漏洞召回率,零样本性能随语义复杂度下降,备忘单在真实数据上效果不佳,迭代重新校准也有问题,证实了SAIR的跨分布权衡及路由器假设的跨领域性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14522 2026-07-17 cs.LG 新提交 57%

A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

用于微调离散扩散模型的连续时间强化学习框架

Zikun Zhang, Jiayuan Sheng, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00492 2026-07-15 cs.AI 版本更新 57%

Rethinking Reward Models for Multi-Domain Test-Time Scaling

重新思考多领域测试时扩展的奖励模型

Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) TH Nürnberg

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11849 2026-07-14 cs.CL 新提交 57%

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification

高级数学基准测试:用于高级数学证明生成与验证的基准测试套件

Lingkai Kong, Zijian Wu, Yuzhe Gu, Haiteng Zhao, Wenyong Huang, Shuang Sun, Zhicheng Xiong, Xiaotian Zhang, Shuya Zhao, Yan Wang, Disheng Xu, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai Jiao Tong University(上海交通大学) Great Bay University(大湾区大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 介绍用于评估高级数学推理能力的AdvancedMathBench基准测试套件,含ProverBench证明生成基准及自动验证管道,还有VerifierBench。实验显示前沿模型在证明生成与验证上表现不佳,该套件对模型提升高级数学证明能力有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏