arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2502.17387 2025-02-25 cs.LG cs.AI cs.CL 75%

Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models

Alon Albalak, Duy Phung, Nathan Lile, Rafael Rafailov, Kanishk Gandhi, Louis Castricato, Anikait Singh, Chase Blagden, Violet Xiang, Dakota Mahan, Nick Haber

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18356 2025-01-31 cs.LG cs.AI cs.CL 75%

State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence

Thea Aviss

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08273 2024-11-19 cs.CL cs.AI cs.LG 75%

Large Language Models are Null-Shot Learners

Pittawat Taveekitworachai, Febri Abdullah, Ruck Thawonmas

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages; v2: added Gemini Pro results, error analysis, and a discussion on confabulation; v3: see its extended version, an EMNLP 2024 paper, at https://aclanthology.org/2024.emnlp-main.740/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08739 2024-11-05 cs.CV 75%

MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine

Renrui Zhang, Xinyu Wei, Dongzhi Jiang, Ziyu Guo, Shicheng Li, Yichi Zhang, Chengzhuo Tong, Jiaming Liu, Aojun Zhou, Bin Wei, Shanghang Zhang, Peng Gao, Chunyuan Li, Hongsheng Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments WData and Models will be released at https://github.com/ZrrSkywalker/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10176 2024-11-05 cs.CL cs.AI cs.LG 75%

OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset

Shubham Toshniwal, Ivan Moshkov, Sean Narenthiran, Daria Gitman, Fei Jia, Igor Gitman

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Camera-ready version for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01560 2024-10-08 cs.CL cs.AI cs.LG 75%

OpenMathInstruct-2: Accelerating AI for Math with Massive Open-Source Instruction Data

Shubham Toshniwal, Wei Du, Ivan Moshkov, Branislav Kisacanin, Alexan Ayrapetyan, Igor Gitman

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18219 2024-07-29 cs.LG cs.AI cs.CL 75%

Recursive Introspection: Teaching Language Model Agents How to Self-Improve

Yuxiao Qu, Tianjun Zhang, Naman Garg, Aviral Kumar

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05492 2024-06-10 cs.CL cs.AI cs.LG 75%

How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition

Guanting Dong, Hongyi Yuan, Keming Lu, Chengpeng Li, Mingfeng Xue, Dayiheng Liu, Wei Wang, Zheng Yuan, Chang Zhou, Jingren Zhou

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12219 2024-04-18 cs.CL cs.AI cs.LG 75%

Reformatted Alignment

Run-Ze Fan, Xuefeng Li, Haoyang Zou, Junlong Li, Shwai He, Ethan Chern, Jiewen Hu, Pengfei Liu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Homepage: https://gair-nlp.github.io/ReAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15670 2024-01-30 cs.CL cs.AI cs.LG 75%

YODA: Teacher-Student Progressive Learning for Language Models

Jianqiao Lu, Wanjun Zhong, Yufei Wang, Zhijiang Guo, Qi Zhu, Wenyong Huang, Yanlin Wang, Fei Mi, Baojun Wang, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 14 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09009 2023-11-01 cs.CL cs.AI cs.LG 75%

How is ChatGPT's behavior changing over time?

Lingjiao Chen, Matei Zaharia, James Zou

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments add more evaluations on instruction following

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16797 2023-10-02 cs.CL cs.AI cs.LG cs.NE 75%

Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution

Chrisantha Fernando, Dylan Banarse, Henryk Michalewski, Simon Osindero, Tim Rocktäschel

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08767 2023-07-19 cs.CL cs.AI cs.LG 75%

A mixed policy to improve performance of language models on math problems

Gang Chen

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-14 cs.CL cs.AI 新提交 74%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交 74%

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26823 2026-05-27 cs.CL 74%

Generating Logically Consistent Synthetic Supply Chain Data with LLM-Driven Knowledge Graph Reasoning

基于LLM驱动知识图谱推理生成逻辑一致的合成供应链数据

Yunbo Long, Ge Zheng, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 数学推理 :reasoning(title);分类 cs.CL

AI总结 针对合成供应链数据需保持操作逻辑一致性的问题,提出TabKG框架,通过构建列关系知识图谱并利用多LLM集成验证关系,结合潜在扩散模型生成逻辑一致的表格数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 74%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04872 2025-12-24 cs.AI 74%

FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI

FrontierMath: 一个评估人工智能高级数学推理能力的基准

Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon

机构 * Epoch AI University of Leicester(利兹大学) RWTH Aachen University(亚琛工业大学) King’s College London(伦敦大学国王学院) University of Bristol(布里斯托大学) Iowa State University(爱荷华州立大学) MIT(麻省理工学院) University of North Carolina(北卡罗来纳大学) CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) University of Siegen(锡根大学) Knox College at Charlotte(夏洛特克恩学院) James Madison University(詹姆斯麦迪逊大学) ICMC, USP(巴西圣保罗大学ICMC分校) Masaryk University(马萨里克大学) UC Berkeley(伯克利加州大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Harvard University(哈佛大学) ETH Zurich(苏黎世联邦理工学院) Independent(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10197 2025-10-02 cs.AI 74%

MathConstruct: Challenging LLM Reasoning with Constructive Proofs

Mislav Balunović, Jasper Dekoninck, Nikola Jovanović, Ivo Petrov, Martin Vechev

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) INSAIT, Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·欧里斯基"学院)

专题命中 数学推理 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03573 2025-06-05 cs.CL 74%

Exchange of Perspective Prompting Enhances Reasoning in Large Language Models

Lin Sun, Can Zhang

专题命中 数学推理 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11899 2025-05-20 cs.AI 74%

From Recall to Reasoning: Automated Question Generation for Deeper Math Learning through Large Language Models

Yongan Yu, Alexandre Krantz, Nikki G. Lobczowski

机构 * McGill University(麦吉尔大学)

专题命中 数学推理 :reasoning(title);分类 cs.AI

Comments 8 pages, 2 figures, accepted by AIED conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09998 2025-01-14 cs.CL math.HO 74%

Controlling Equational Reasoning in Large Language Models with Prompt Interventions

Jordan Meadows, Marco Valentino, Andre Freitas

专题命中 数学推理 :reasoning(title);分类 cs.CL

Comments AAAI 2025 (7 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.13512 2022-05-18 cs.AI cs.CV cs.RO 74%

Projection: A Mechanism for Human-like Reasoning in Artificial Intelligence

Frank Guerin

专题命中 数学推理 :reasoning(title);分类 cs.AI

Comments 29 pages, 3 figures. Some minor additions/clarifications in this revision, e.g. mathematical description

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.02031 2018-09-07 cs.AI 74%

Planning with Arithmetic and Geometric Attributes

David Folqué, Sainbayar Sukhbaatar, Arthur Szlam, Joan Bruna

专题命中 数学推理 :planning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16627 2026-08-18 cs.CL cs.AI 新提交 73%

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

解释何时能帮助上下文学习?自然语言解释类型与忠实度的比较研究

Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank, Gjergji Kasneci

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) Technical University of Munich(慕尼黑工业大学) MaiNLP lab, CIS, LMU Munich(慕尼黑大学CIS研究所MaiNLP实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过在6个基准和4个指令调优模型上的比较评估,探究不同来源与选择方式的自然语言解释对上下文学习下游性能的影响,为实际提示流程中解释的选择和报告提供了见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02621 2026-08-12 cs.CL cs.LG 版本更新 73%

Reinforcement Learning-based Semi-supervised Knowledge Distillation with LLM-as-a-Judge

基于强化学习的知识蒸馏与大语言模型作为评判者

Yiyang Shen, Lifu Tu, Weiran Wang

机构 * University of Iowa(爱荷华大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05687 2026-08-07 cs.CL cs.AI 新提交 73%

Answer First, Reason Later: Commitment Order in Diffusion LLMs

先给出答案,后进行推理:扩散大语言模型中的承诺顺序

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Hwiyeong Lee, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现扩散大语言模型(dLLMs)的任意顺序提交机制会导致推理失败,通过前沿门控承诺干预可恢复推理性能,同时保留并行解码优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27705 2026-07-31 cs.AI cs.LG 新提交 73%

Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration

Albilich:用于结合计算机代数系统(CAS)的基于大语言模型的数学研究的可操控证明状态编排工具

Ting Gong, Michael Ruofan Zeng, Yong Yang

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 Albilich是结合CAS等功能的开源数学自主研究智能体框架,在RealMath基准和Kourovka开放问题上取得优异效果,可实现AI辅助的可扩展数学研究。

Comments 7 pages, comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏