arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45006 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1127 篇

2403.04017 2025-06-23 cs.AI cs.LG cs.LO cs.NE cs.SC 84%

Learning Guided Automated Reasoning: A Brief Survey

Lasse Blaauwbroek, David Cerna, Thibault Gauthier, Jan Jakubův, Cezary Kaliszyk, Martin Suda, Josef Urban

机构 * Czech Technical University in Prague(捷克技术大学布拉格) Radboud University Nijmegen(拉德堡德大学奈杰姆) Czech Academy of Sciences Institute for Computer Science(捷克科学院计算机科学研究所) University of Innsbruck(因斯布鲁克大学)

专题命中 代码与定理证明 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02735 2025-05-06 cs.AI cs.LG 84%

FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models

Zhouliang Yu, Ruotian Peng, Keyi Ding, Yizhe Li, Zhongyuan Peng, Minghao Liu, Yifan Zhang, Zheng Yuan, Huajian Xin, Wenhao Huang, Yandong Wen, Ge Zhang, Weiyang Liu

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

Comments Technical Report v1 (33 pages, 8 figures, project page: https://sphere-ai-lab.github.io/FormalMATH/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06586 2024-06-12 cs.CL cs.AI 84%

Bi-Chainer: Automated Large Language Models Reasoning with Bidirectional Chaining

Shuqi Liu, Bowei He, Linqi Song

专题命中 代码与定理证明 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 84%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18831 2026-06-17 cs.CL 版本更新 83%

Adaptive Activation Steering for Efficient LLM Reasoning via Closed-Loop PID Control

自适应激活引导:通过闭环PID控制实现高效LLM推理

Aryasomayajula Ram Bharadwaj

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出PID-steering方法,利用PID控制器根据块级冗余分类器动态调整激活引导强度,在减少推理开销的同时提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11521 2026-06-11 cs.LG 新提交 83%

Counterexample Guided Learning in the Large using Reasoning Agents

使用推理代理的大规模反例引导学习

Hongyi Liu, Frederic Sala, Thomas Reps, Adithya Murali

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 代码与定理证明 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 提出反例引导的LLM正则表达式归纳框架,通过验证器反馈和代理策略(如反思与修复循环)显著提升样本效率和复杂任务成功率。

Comments Code, data, and resources are publicly available for research purposes: https://github.com/Lhtie/CEGML

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08011 2026-05-11 cs.AI stat.CO 83%

Abductive Reasoning with Probabilistic Commonsense

基于概率常识的归纳推理

Joseph Cotnareanu, Chiara Roverato, Han Zhou, Didier Chetelat, Yingxue Zhang, Mark Coates

机构 * International Laboratory on Learning Systems(学习系统国际实验室) McGill University(麦吉尔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PACS算法,通过LLM和形式求解器结合,建模常识认知的个体差异,提升大语言模型的归纳推理能力。

Journal ref Proceedings of the International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL 83%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 代码与定理证明 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21152 2026-03-27 physics.geo-ph cs.AI 83%

TRACE: A Multi-Agent System for Autonomous Physical Reasoning for Seismology

TRACE:一种用于地震学自主物理推理的多智能体系统

Feng Liu, Jian Xu, Xin Cui, Xinghao Wang, Zijie Guo, Jiong Wang, S. Mostafa Mousavi, Xinyu Gu, Hao Chen, Ben Fei, Lihua Fang, Fenghua Ling, Zefeng Li, Lei Bai

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Earth and Space Sciences, University of Science and Technology of China(中国科学技术大学地球和空间科学学院) Department of Earth and Planetary Sciences, Harvard University(哈佛大学地球与行星科学系) Institute of Earthquake Forecasting, China Earthquake Administration(中国地震局地震预报研究所)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 TRACE通过结合大语言模型规划与正式地震学约束,从原始观测中推导出可审计的物理机制,解决了地震序列物理机制推断的挑战,推动了地球科学从专家依赖分析向知识引导的自主发现发展。

Comments 25 pages for main text and 164 pages for appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13443 2026-03-17 cs.SE cs.AI cs.PL 83%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01896 2026-03-05 cs.SE cs.AI cs.PL 83%

Agentic Code Reasoning

代理代码推理

Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出半形式推理方法,通过结构化提示提升代理在代码补丁验证、故障定位和问答任务中的准确性,实现无需执行的代码语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17716 2026-01-27 cs.LG 83%

Do Reasoning Models Ask Better Questions? A Formal Information-Theoretic Analysis on Multi-Turn LLM Games

推理模型会提出更好的问题吗?多轮LLM游戏中的信息论分析

Daniel M. Pedrozo, Telma W. de L. Soares, Bryan L. M. de Oliveira

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出多轮对话框架,通过信息增益评估LLM在地理游戏中提问效率,发现具有推理能力的模型在部分可观察环境下表现更优。

Comments Presented at the NeusymBridge Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22738 2025-12-01 cs.LG cs.CR 83%

ShieldAgent: Shielding Agents via Verifiable Safety Policy Reasoning

ShieldAgent: 通过可验证的安全策略推理实现安全代理

Zhaorun Chen, Mintong Kang, Bo Li

机构 * University of Chicago, Chicago IL, USA(芝加哥大学) University of Illinois at Urbana-Champaign, Champaign IL, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 ShieldAgent通过逻辑推理实现对代理动作轨迹的安全策略合规性,有效提升代理防护性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23686 2025-10-22 cs.CL cs.PL cs.SE 83%

Evaluating Program Semantics Reasoning with Type Inference in System F

Yifeng He, Luning Yang, Christopher Castro Gaw Gonzalo, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL

Comments NeurIPS '25, package released at: https://github.com/SecurityLab-UCD/TF-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12164 2025-10-15 cs.CL 83%

A Survey on Parallel Reasoning

Ziqi Wang, Boye Niu, Zipeng Gao, Zhi Zheng, Tong Xu, Linghui Meng, Zhongli Li, Jing Liu, Yilong Chen, Chen Zhu, Hua Wu, Haifeng Wang, Enhong Chen

机构 * USTC(中国科学技术大学) Baidu(百度) USYD(悉尼大学)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14119 2025-10-14 cs.AI cs.SE 83%

CodeCrash: Exposing LLM Fragility to Misleading Natural Language in Code Reasoning

Man Ho Lam, Chaozheng Wang, Jen-tse Huang, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments NeurIPS 2025; 10 pages of main text; 25 pages of appendices. Website - https://cuhk-arise.github.io/CodeCrash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11461 2025-10-09 cs.AI 83%

Hint of Pseudo Code (HoPC): Zero-Shot Step by Step Pseudo Code Reasoning Prompting

Iok Tong Lei, Ziyu Zhu, Han Yu, Yige Yao, Zhidong Deng

机构 * Department of Computer Science and Technology(计算机科学与技术系) Institute for Artificial Intelligence at Tsinghua University(清华大学人工智能研究院) Beijing National Research Center for Information Science and Technology(北京信息科学国家研究中心) Tsinghua University(清华大学)

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15739 2025-09-22 cs.CL 83%

Can LLMs Judge Debates? Evaluating Non-Linear Reasoning via Argumentation Theory Semantics

Reza Sanayei, Srdjan Vesic, Eduardo Blanco, Mihai Surdeanu

机构 * Department of Computer Science, University of Arizona(亚利桑那大学计算机科学系) CRIL CNRS & University of Artois(CNRS CRIL与阿维尼昂大学)

专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00963 2025-06-12 cs.LG 83%

PDE-Controller: LLMs for Autoformalization and Reasoning of PDEs

Mauricio Soroco, Jialin Song, Mengzhou Xia, Kye Emond, Weiran Sun, Wuyang Chen

机构 * Princeton University(普林斯顿大学) Simon Fraser University(西蒙弗雷泽大学) School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算科学学院)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17481 2025-05-26 cs.CL 83%

MARCO: Meta-Reflection with Cross-Referencing for Code Reasoning

Yusheng Zhao, Xiao Luo, Weizhi Zhang, Wei Ju, Zhiping Xiao, Philip S. Yu, Ming Zhang

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Washington(华盛顿大学)

专题命中 代码与定理证明 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06176 2026-02-09 cs.AI cs.CL cs.LG 83%

Large Language Model Reasoning Failures

大语言模型推理失败

Peiyang Song, Pengrui Han, Noah Goodman

机构 * California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) Carleton College(卡尔顿学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文首次系统调查大语言模型推理失败问题,提出分类框架并分析其根本原因,旨在提升模型的推理能力与鲁棒性。

Comments Repository: https://github.com/Peiyang-Song/Awesome-LLM-Reasoning-Failures. Published at TMLR 2026 with Survey Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17270 2024-10-24 cs.AI cs.CL cs.LG cs.LO cs.NE 83%

Proof of Thought : Neurosymbolic Program Synthesis allows Robust and Interpretable Reasoning

Debargha Ganguly, Srinivasan Iyengar, Vipin Chaudhary, Shivkumar Kalyanaraman

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024) System 2 Reasoning At Scale Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16458 2026-08-18 cs.AR 新提交 82%

TRACE: Traversal and Reasoning Algebraic Computing Engine for Formal Hardware Verification

TRACE:用于形式化硬件验证的遍历与推理代数计算引擎

Jan Kleinekathöfer, Lennart Weingarten, Kamalika Datta, Rolf Drechsler

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 针对AI时代算术原语验证的计算瓶颈,提出SCA框架TRACE,采用优化归约技术,首次成功验证此前无法验证的优化MAC电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06690 2026-05-11 cs.AI cs.CL cs.LG 82%

State Representation and Termination for Recursive Reasoning Systems

递归推理系统的状态表示与终止

Debashis Guha, Amritendu Mukherjee, Sanjay Kukreja, Tarun Kumar

机构 * S P Jain School of Global Management(S P Jain 全球管理学院) Indian Statistical Institute(印度统计研究所) eClerx Services Ltd.(eClerx 服务有限公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种递归推理系统的状态表示方法及终止条件,通过epistemic状态图编码提取的主张、证据关系、开放问题和置信度权重,并定义了顺序间隙以判断迭代的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12059 2026-04-30 cs.CL cs.AI cs.LG 82%

MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning

MeTHanol:模块化思维语言模型与中间层思维、解码与推理bootstrap

Ningyuan Xi, Xiaoyu Wang, Yetao Wu, Teng Chen, Qingqing Gu, Yue Zhao, Jinxian Qu, Zhonglin Jiang, Yong Chen, Luo Ji

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Geely AI Lab(吉利人工智能实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MeTHanol模块化思维语言模型,通过中间层思维解码与双阶段推理提升LLM的认知能力,实验表明其在理论思维和 vignette 任务中表现出色,能规划、反思并生成类人回答。

Comments 19 pages, 7 figures. IJCNN2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20917 2026-04-24 cs.LG cs.AI cs.CL cs.PL cs.SE 82%

The Path Not Taken: Duality in Reasoning about Program Execution

未选择的道路:程序执行推理中的对偶性

Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker, Aashish Yadavally

机构 * Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过双重推理任务评估程序执行的因果理解,提出DexBench基准测试集,评估13种LLM,证明双路径推理能有效提升动态代码理解能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19558 2026-04-22 cs.SE 82%

On Reasoning-Centric LLM-based Automated Theorem Proving

基于推理的LLM自动定理证明方法

Yican Sun, Chengwei Shi, Hangzhou Lyu, Yingfei Xiong

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出ReCent-Prover,通过引入反思验证和规划检索技术,提升自动定理证明能力,在CoqStoq基准测试中实现22.58%的定理证明提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17010 2026-04-21 cs.CL cs.AI cs.LG cs.PL 82%

Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification

通过形式验证的语义等价自博弈提升大语言模型代码推理

Antonio Valerio Miceli Barone, Poon Tsz Nok

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于形式验证的语义等价自博弈框架,利用对抗训练提升代码推理能力,通过验证等价性与非等价性,释放OpInstruct-HSx数据集,实验显示在EquiBench上提升13.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02709 2026-04-16 cs.CL cs.AI cs.LG cs.SE 82%

Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy

通过乔姆斯基层级评估大语言模型的正式推理能力

Yihong Dong, Jianha Xiao, Xue Jiang, Xuyuan Guo, Zhiyuan Fan, Jiaru Qian, Kechi Zhang, Jia Li, Zhi Jin, Ge Li

机构 * Peking University(北京大学) Wuhan University(武汉大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ChomskyBench基准,通过乔姆斯基层级系统评估大语言模型的正式推理能力,揭示其在结构化语言处理中的性能分层及效率瓶颈。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13962 2026-02-17 cs.SE 82%

CodeGlance: Understanding Code Reasoning Challenges in LLMs through Multi-Dimensional Feature Analysis

CodeGlance:通过多维特征分析理解LLM中的代码推理挑战

Yunkun Wang, Xuanhe Zhang, Junxiao Han, Chen Zhi, Shuiguang Deng

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract)

AI总结 CodeGlance通过多维特征分析揭示LLM在代码推理中的挑战,发现未见过的函数推理对小型模型尤为困难,提出改进策略并提供开发指导。

详情

展开后加载摘要…

URL PDF HTML 收藏