arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-10 至 2026-07-10 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2604.13356 2026-07-10 cs.CL cs.AI cs.GT 版本更新 84%

Peer-Predictive Self-Training for Language Model Reasoning

同伴预测自训练用于语言模型推理

Shi Feng, Hanlin Zhang, Fan Nie, Sham Kakade, Yiling Chen

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PST框架,通过多模型协作利用交叉模型聚合响应作为内部训练信号,提升数学推理任务的准确率并减少生成-验证差距。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 62%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08018 2026-07-10 cs.AI 新提交 57%

Concretized Proposition Prompting Resolves Composition-Knowledge Dichotomy in Large Language Models

具体化命题提示解决大语言模型中的组合-知识二分法

Changhun Lee, Minguk Jeon, Jongkyung Shin, Chiehyeon Lim

机构 * Columbia University(哥伦比亚大学) UNIST(全南科学技术大学) POSCO Holdings(POSCO控股)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型组合-知识二分法难题,提出具体化命题提示(CPP)框架。通过明确相关命题具体化,提升推理性能,尤其在医学基准测试中表现突出,且可扩展到多种模型和参数规模,弥合两类方法差距,解决了二分法问题。

Comments 9

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07727 2026-07-10 cs.PL cs.CL 新提交 57%

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

SPL:使用声明式确定性-概率性组合编排工作流

Wen G. Gong

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :verifier(abstract);分类 cs.CL

AI总结 研究提出SPL语言统一确定性与概率性计算模式,通过共享语法等实现跨平台运行。经实验验证,求解器分支有较高机器验证正确性,对比仅用大语言模型的分支,呈现后端难度梯度,主要失败模式为求解器错误。

Comments 24 pages, 2 figures, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新 57%

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏