arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45006 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1127 篇

2510.06002 2026-04-30 cs.AI cs.CL cs.IR 81%

Deterministic Legal Agents: A Canonical Primitive API for Auditable Reasoning over Temporal Knowledge Graphs

确定性法律代理:用于可审计时间知识图谱推理的规范性原始API

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦议会)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAT-Graph API,通过确定性符号子系统与概率语言模型交互,实现法律领域可审计的时间知识图谱推理,将单次检索生成改为主动推理-行动-观察流程。

Comments Substantially revised version consolidating the paper as a formal SAT-Graph API specification: clarifies Probability Isolation and post-anchoring determinism, broadens semantic anchoring to open and thematic legal queries, refines the data models and temporal primitives, and strengthens the use cases, limitations, and bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09664 2026-04-08 cs.SE cs.AI cs.CL cs.PL 81%

CodeMind: Evaluating Large Language Models for Code Reasoning

CodeMind: 评估大型语言模型的代码推理能力

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12189 2026-04-02 cs.AI cs.CL 81%

Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steering

通过细粒度激活引导缓解语言模型中的内容影响

Marco Valentino, Geonhee Kim, Dhairya Dalal, Zhixue Zhao, André Freitas

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过激活引导技术缓解语言模型的推理偏见,发现对比引导方法能有效减少内容偏见,提升形式推理准确性,且在不同任务中具有鲁棒性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29500 2026-04-01 cs.AI cs.LG 81%

Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries

通过结构化形式中介学习生成可形式验证的逐步逻辑推理

Luoxin Chen, Yichi Zhou, Huishuai Zhang

机构 * Wangxuan Institue of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRoSFI方法,通过形式验证提升推理可靠性,利用结构化中间步骤和形式证明验证生成可信的逐步推理过程。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13372 2026-03-17 cs.AI cs.LG 81%

The ARC of Progress towards AGI: A Living Survey of Abstraction and Reasoning

为AGI进步的ARC:抽象与推理的活体调查

Sahar Vahdati, Andrei Aioanei, Haridhra Suresh, Jens Lehmann

机构 * TIB - Leibniz Information Centre for Science and Technology(TIB - 科学技术信息研究中心) L3S Research Center, Leibniz University of Hannover(L3S研究所以汉诺威莱布尼茨大学) Dresden University of Technology, Amazon (work done outside of Amazon)(德累斯顿技术大学,亚马逊(非亚马逊工作))

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析三个版本的82种方法及ARC Prize竞赛,揭示了不同范式在版本间性能下降的规律,指出组合泛化能力的局限性,并强调测试时适应和精炼循环的重要性。

Comments Submitted to ACM Computing Surveys. Living survey website: https://nimi-ai.com/arc-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05962 2026-03-09 cs.LG cs.AI 81%

Whatever Remains Must Be True: Filtering Drives Reasoning in LLMs, Shaping Diversity

Whatever Remains Must Be True: 过滤驱动LLM推理,塑造多样性

Germán Kruszewski, Pierre Erbacher, Jos Rozen, Marc Dymetman

机构 * NAVER Labs Europe(NAVER欧洲实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过过滤错误答案获得目标分布,利用α-散度族控制精度与多样性权衡,提升LLM在推理任务中的覆盖与精度表现。

Comments Published as an ICLR 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19160 2026-02-24 cs.AI cs.CL cs.LO 81%

Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing

大语言模型的推理能力。从通用游戏玩法中获得的教训

Maciej Świechowski, Adam Żychowski, Jacek Mańdziuk

机构 * Grail Team(Grail团队) Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过通用游戏玩法任务评估大语言模型的推理能力,发现部分模型在多步骤任务中表现稳定,但随着任务复杂度增加性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02462 2026-02-03 cs.CL cs.AI 81%

Abstract Activation Spaces for Content-Invariant Reasoning in Large Language Models

抽象激活空间用于大语言模型中的内容不变推理

Gabriele Maraia, Marco Valentino, Fabio Massimo Zanzotto, Leonardo Ranaldi

机构 * Human Centric ART, University of Rome Tor Vergata(人类中心ART,罗马大学托尔维加塔分校) ILCC, School of Informatics, University of Edinburgh(ILCC,信息学院,爱丁堡大学) School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学) Almawave S.p.A.(Almawave公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种抽象引导推理框架,通过分离结构推理与词法语义,减少语义干扰对形式推理的影响,提升大语言模型的推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12620 2025-12-30 cs.CL cs.AI 81%

Understanding Syllogistic Reasoning in LLMs from Formal and Natural Language Perspectives

从形式和自然语言角度理解大语言模型中的三段论推理

Aheli Poddar, Saptarshi Sahoo, Sujata Ghosh

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文从形式和自然语言角度研究大语言模型的三段论推理能力,通过测试14种模型的符号推理和自然语言理解,探讨大语言模型是否正向形式化推理机制发展。

Comments 9 pages, 4 figures, 5 tables. Accepted at AAAI 2026 Bridge Program on Logic & AI. Code available at https://github.com/XAheli/Logic-in-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09222 2025-12-11 cs.CL cs.AI 81%

CORE: A Conceptual Reasoning Layer for Large Language Models

CORE:大型语言模型的概念推理层

Vishwas Hegde, Vindhya Shigehalli

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CORE通过引入概念优先的交互层,提升大型语言模型在多轮对话中的稳定性,利用持久的局部概念和通用认知运算符,减少提示token数量,实现更稳定的多轮交互。

Comments Independent system-level architectural proposal with accompanying proof-of-concept

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15715 2025-11-21 cs.AI cs.LG 81%

Graph-Memoized Reasoning: Foundations Structured Workflow Reuse in Intelligent Systems

图记忆推理:智能系统中结构化工作流重用的基础

Yash Raj Singh

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 图记忆推理通过图结构内存实现推理工作流的重用,旨在提升智能系统中的效率与可重复性。

Comments 5 Pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19060 2025-11-18 cs.CR cs.CL cs.LG cs.SE 81%

PurpCode: Reasoning for Safer Code Generation

Jiawei Liu, Nirav Diwan, Zhe Wang, Haoyu Zhai, Xiaona Zhou, Kiet A. Nguyen, Tianjiao Yu, Muntasir Wahed, Yinlin Deng, Hadjer Benkraouda, Yuxiang Wei, Lingming Zhang, Ismini Lourentzou, Gang Wang

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19850 2025-10-24 cs.PL cs.AI cs.CL cs.HC 81%

Prompt Decorators: A Declarative and Composable Syntax for Reasoning, Formatting, and Control in LLMs

Mostapha Kalami Heris

机构 * School of Engineering and Built Environment(工程与建筑环境学院) College of Business(商学院) Sheffield Hallam University(谢菲尔德哈姆大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11986 2025-10-15 cs.CL cs.AI 81%

Conjecturing: An Overlooked Step in Formal Mathematical Reasoning

Jasivan Alex Sivakumar, Philipp Borchert, Ronald Cardenas, Gerasimos Lampouras

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11572 2025-09-16 cs.AI cs.CL 81%

Formal Reasoning for Intelligent QA Systems: A Case Study in the Educational Domain

Tuan Bui, An Nguyen, Phat Thai, Minh Hua, Ngan Pham L. N., Ngan Pham T. B., Dung Le, Long Nguyen, Thanh-Tung Tran, Thang Bui, Tho Quan

机构 * Ho Chi Minh City University of Technology (HCMUT) - VNU-HCM(胡志明市技术大学(HCMUT)- VNU-HCM) International University - VNU-HCM(国际大学 - VNU-HCM)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Published at the 2nd ACM Workshop in AI-powered Question & Answering Systems (AIQAM '25), co-located with ACM Multimedia 2025

Journal ref Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06809 2025-09-09 cs.CL cs.AI 81%

Saturation-Driven Dataset Generation for LLM Mathematical Reasoning in the TPTP Ecosystem

Valentin Quesnel, Damien Sileo

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19576 2025-09-09 cs.AI cs.LG 81%

ReST-RL: Achieving Accurate Code Reasoning of LLMs with Optimized Self-Training and Decoding

Sining Zhoubian, Dan Zhang, Jie Tang

机构 * The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG)、清华大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19201 2025-08-27 cs.LG cs.AI stat.ML 81%

Understanding Tool-Integrated Reasoning

Heng Lin, Zhongwen Xu

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17692 2025-08-26 cs.AI cs.CL 81%

LLM-based Agentic Reasoning Frameworks: A Survey from Methods to Scenarios

Bingxi Zhao, Lin Geng Foo, Ping Hu, Christian Theobalt, Hossein Rahmani, Jun Liu

机构 * Beijing Jiaotong University(北京交通大学) Lancaster University(兰卡斯特大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰州信息学校区) University of Electronic Science and Technology of China(电子科技大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 51 pages,10 figures,8 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04352 2025-08-26 cs.CL cs.AI 81%

Investigating the Robustness of Deductive Reasoning with Large Language Models

Fabian Hoppe, Filip Ilievski, Jan-Christoph Kalo

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Universiteit van Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments to be published in ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11386 2025-08-18 cs.CL cs.AI cs.CY 81%

Retrieval-augmented reasoning with lean language models

Ryan Sze-Yin Chan, Federico Nanni, Tomas Lazauskas, Rosie Wood, Penelope Yong, Lionel Tarassenko, Mark Girolami, James Geddes, Andrew Duncan

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23754 2025-06-04 cs.CL cs.AI 81%

DeepTheorem: Advancing LLM Reasoning for Theorem Proving Through Natural Language and Reinforcement Learning

Ziyin Zhang, Jiahao Xu, Zhiwei He, Tian Liang, Qiuzhi Liu, Yansi Li, Linfeng Song, Zhenwen Liang, Zhuosheng Zhang, Rui Wang, Zhaopeng Tu, Haitao Mi, Dong Yu

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13913 2025-05-29 cs.CL cs.AI 81%

How Do LLMs Perform Two-Hop Reasoning in Context?

Tianyu Guo, Hanlin Zhu, Ruiqi Zhang, Jiantao Jiao, Song Mei, Michael I. Jordan, Stuart Russell

机构 * Department of Statistics, UC Berkeley(统计学系,伯克利大学) Department of EECS, UC Berkeley(电子工程与计算机科学系,伯克利大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20047 2025-05-27 cs.CL cs.AI cs.LO cs.SE 81%

Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks

Debargha Ganguly, Vikash Singh, Sreehari Sankar, Biyao Zhang, Xuecen Zhang, Srinivasan Iyengar, Xiaotian Han, Amit Sharma, Shivkumar Kalyanaraman, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) Microsoft Corporation(微软公司) Microsoft Research(微软研究院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17216 2025-05-22 cs.AI cs.CL 81%

Intermediate Languages Matter: Formal Choice Drives Neurosymbolic LLM Reasoning

Alexander Beiser, David Penz, Nysret Musliu

机构 * TU Wien, Vienna, Austria(维也纳技术大学) Johannes Kepler University Linz, Linz, Austria(林茨约翰尼斯·凯普勒大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09858 2025-04-15 cs.AI cs.CL 81%

Reasoning Models Can Be Effective Without Thinking

Wenjie Ma, Jingxuan He, Charlie Snell, Tyler Griggs, Sewon Min, Matei Zaharia

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 33 pages, 7 main figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05518 2025-04-09 cs.SE cs.CL cs.LG 81%

Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning

Rem Yang, Julian Dai, Nikos Vasilakis, Martin Rinard

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04110 2025-04-08 cs.AI cs.CL 81%

PEIRCE: Unifying Material and Formal Reasoning via LLM-Driven Neuro-Symbolic Refinement

Xin Quan, Marco Valentino, Danilo S. Carvalho, Dhairya Dalal, André Freitas

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Demo paper. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02976 2025-04-07 cs.LG cs.AI 81%

Localized Definitions and Distributed Reasoning: A Proof-of-Concept Mechanistic Interpretability Study via Activation Patching

Nooshin Bahador

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24110 2025-04-01 cs.AI cs.CL 81%

Grounding Agent Reasoning in Image Schemas: A Neurosymbolic Approach to Embodied Cognition

François Olivier, Zied Bouraoui

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏