arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2605.11922 2026-05-13 cs.SE cs.CL 79%

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23238 2026-05-12 cs.CR cs.AI 79%

Hiding in Plain Sight: Detectability-Aware Antidistillation of Reasoning Models

明目张胆:面向可检测性的推理模型抗蒸馏

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Yash Savani, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Stony Brook University(石溪大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种面向可检测性的抗蒸馏方法,通过Stackelberg博弈框架显式编码可检测性约束,以稀疏扰动替代全迹中毒,提升教师模型性能并降低防御可见性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27713 2026-05-01 cs.AI 79%

Knowledge Graph Representations for LLM-Based Policy Compliance Reasoning

基于LLM的政策合规推理的知识图谱表示

Wilder Baldwin, Sepideh Ghanavati

机构 * University of Maine(缅因大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一个框架,通过构建知识图谱从AI政策文档中检索相关信息,评估五种LLM在42个政策问答任务上的表现,证明知识图谱增强提升了模型性能,且开放的LLM发现模式达到或超越了正式本体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06635 2026-04-30 cs.LG 79%

Graph Property Inference in Small Language Models: Effects of Representation and Reasoning Strategy

在小型语言模型中进行图属性推断:表示与推理策略的影响

Michal Podstawski

机构 * NASK National Research Institute, Warsaw, Poland(波兰华沙国家研究 institute)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

AI总结 研究探讨了小型指令微调语言模型在图属性推断中的表现,发现输入表示和推理策略显著影响结果,未经过微调的模型在估计图属性时存在系统性误差,但通过改进表示和推理设计可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23563 2026-04-28 cs.CR cs.AI cs.IR 79%

CyberCane: Neuro-Symbolic RAG for Privacy-Preserving Phishing Detection with Formal Ontology Reasoning

CyberCane:基于形式本体推理的隐私保护钓鱼检测神经符号RAG

Safayat Bin Hakim, Aniqa Afzal, Qi Zhao, Vigna Majmundar, Pawel Sloboda, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bowie State University(鲍威州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 CyberCane结合确定性符号分析与隐私保护RAG,通过形式本体推理实现高召回率的钓鱼检测,在隐私保护和抗AI攻击方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10899 2026-04-22 cs.CL cs.LO cs.SE 79%

From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models

从证明到程序:刻画大语言模型中的工具诱导推理幻觉

Farima Fatahi Bayat, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了工具增强语言模型在使用外部工具时产生的推理幻觉问题,通过PYMATH基准测试发现,尽管工具使用提升了最终答案准确率,但推理过程却愈发不连贯,提出基于偏好优化的框架以改善工具使用下的推理深度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO 79%

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 79%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13356 2026-04-14 cs.CY cs.CL 79%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05080 2026-04-08 cs.SE cs.AI cs.LO cs.MA 79%

Nidus: Externalized Reasoning for AI-Assisted Engineering

Nidus:面向AI辅助工程的外部化推理

Danil Gorinevski

机构 * cybiont GmbH(cybiont有限公司)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Nidus通过外部化推理机制,实现了AI辅助软件交付中的V模型机械化,通过约束表面确保工程不变量的可靠性,提出递归自治理、协同机制、规范强化和治理剧场预防四项贡献。

Comments 19 pages, 3 figures, 5 tables. Evaluated on self-hosting deployment. Patent pending (CH000371/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25810 2026-03-31 cs.PL cs.LG 79%

ExVerus: Verus Proof Repair via Counterexample Reasoning

ExVerus:通过反例推理进行证明修复

Jun Yang, Yuechun Sun, Yi Wu, Rodrigo Caridad, Yongwei Yuan, Jianan Yao, Shan Lu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Purdue University(普渡大学) The University of Toronto(多伦多大学) Microsoft Research(微软研究院)

专题命中 代码与定理证明 :reasoning(title);verifier(abstract);分类 cs.LG

AI总结 ExVerus利用反例推理指导LLM生成更准确的证明,通过自动生成和验证反例来提高证明的鲁棒性和效率。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14703 2026-03-17 cs.SE cs.AI 79%

Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization

超越局部代码优化:软件系统优化的多智能体推理

Huiyun Peng, Parth Vinod Patil, Antonio Zhong Qiu, George K. Thiruvathukal, James C. Davis

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出多智能体框架,通过整合控制流、数据流与架构依赖信号,实现微服务系统的整体优化,提升吞吐量和响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07997 2026-03-12 cs.CL 79%

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

BiasCause: 评估大型语言模型的社会偏见因果推理

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda

机构 * Google(谷歌) The Ohio State University(俄亥俄州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出BiasCause框架,评估LLMs在回答社会偏见问题时的因果推理,揭示其偏见产生机制及去偏策略。

Comments This work has been done when the first author is at Google. The first author is a student at the Ohio State University

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 79%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01012 2026-03-04 cs.SE cs.AI 79%

FastCode: Fast and Cost-Efficient Code Understanding and Reasoning

FastCode: 快速且成本有效的代码理解和推理

Zhonghang Li, Zongwei Li, Yuxuan Chen, Han Shi, Jiawei Li, Jierun Chen, Haoli Bai, Chao Huang

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 FastCode通过结构化勘探机制提升代码推理效率,减少计算成本,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20973 2026-02-25 cs.CL 79%

Linear Reasoning vs. Proof by Cases: Obstacles for Large Language Models in FOL Problem Solving

线性推理与证明中的反证法:大型语言模型在一阶逻辑问题解决中的障碍

Yuliang Ji, Fuchen Shen, Jian Wu, Qiujie Xie, Yue Zhang

机构 * Nanjing University of Science and Technology(南京理工大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PC-FOL数据集,通过对比线性推理与基于情况的推理,揭示大型语言模型在FOL问题解决中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07443 2026-02-17 cs.AI cs.GT 79%

Approximating Human Strategic Reasoning with LLM-Enhanced Recursive Reasoners Leveraging Multi-agent Hypergames

用LLM增强的递归推理器近似人类战略推理

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

机构 * Royal Holloway University of London(伦敦皇家霍洛威大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM增强的递归推理器框架,通过多智能体超游戏模型评估LLM的递归推理能力,并展示了其在近似人类行为和最优解达成方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18880 2026-01-27 cs.AI 79%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14027 2026-01-21 cs.AI 79%

Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics

Numina-Lean-Agent: 一种面向形式数学的开放且通用的代理推理系统

Junqi Liu, Zihao Zhou, Zekai Zhu, Marco Dos Santos, Weikun He, Jiawei Liu, Ran Wang, Yunzhou Xie, Junqiao Zhao, Qiufeng Wang, Lihong Zhi, Jia Li, Wenda Li

机构 * Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Tongji University(同济大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Liverpool(利物浦大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Numina-Lean-Agent通过通用编码代理实现形式数学推理,解决Putnam 2025全部问题并成功形式化Brascamp-Lieb定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08710 2026-01-21 cs.CL 79%

Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning

深入思考,而非总是更聪明:评估大语言模型在分层法律推理中的能力

Li Zhang, Matthias Grabmair, Morgan Gray, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个框架评估大语言模型在分层法律推理中的能力,发现模型在表面推理准确但分层推理表现下降,揭示了模型在复杂领域中的局限性。

Comments 15 pages, 7 figures, Proceedings of the 2026 Symposium on Computer Science and Law (CSLAW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05269 2026-01-21 cs.SE cs.AI 79%

CoRe: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks

CoRe:通过静态分析任务基准测试LLM的代码推理能力

Danning Xie, Mingwei Zheng, Xuwei Liu, Jiannan Wang, Chengpeng Wang, Lin Tan, Xiangyu Zhang

机构 * Department of Computer Science Purdue University(计算机科学系 帕克森大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 CoRe通过静态分析任务评估LLM的代码推理能力,发现主流模型在深层次语义理解和多步骤推理上存在不足。

Comments NeurIPS 2025 Datasets & Benchmarks Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03731 2026-01-12 cs.SE cs.AI 79%

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

从实验室到现实应用:在仓库级别评估代理代码推理

Jia Li, Yuxin Su, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13725 2025-12-25 cs.AI 79%

Compressed Causal Reasoning: Quantization and GraphRAG Effects on Interventional and Counterfactual Accuracy

压缩因果推理:量化与图RAG对干预和反事实准确率的影响

Steve Nwaiwu, Nipat Jongsawat, Anucha Tungkasthan

机构 * School of Data and Information(数据与信息学院) Rajamangala University of Technology(拉贾穆angala技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨量化与图结构增强对因果推理准确率的影响,发现四比特量化对因果推理具有鲁棒性,图结构增强可提升干预准确性,现有反事实基准需改进以捕捉更深层次因果脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16958 2025-12-23 cs.AI 79%

Quantum Abduction: A New Paradigm for Reasoning under Uncertainty

量子反向推理:一种在不确定性下推理的新范式

Remo Pareschi

机构 * Stake Lab, University of Molise(斯泰克实验室,莫利塞大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 量子反向推理通过非经典范式模拟人类在不确定性下的多线索推理,实现动态综合而非排除,适用于历史谜团、文学、医学和科学理论变革等领域。

Comments 23 pages, 8 figures, 3 tables; submitted to Sci, MDPI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19942 2025-12-12 cs.LG 79%

Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning

微分平滑缓解锐化并提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Huaqing Zhang, Aditi Raghunathan

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

AI总结 微分平滑通过缓解RL微调中的锐化问题,提升大语言模型的推理能力和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL 79%

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08026 2025-12-10 cs.AI 79%

Toward an AI Reasoning-Enabled System for Patient-Clinical Trial Matching

迈向基于AI推理的患者-临床试验匹配系统

Caroline N. Leach, Mitchell A. Klusty, Samuel E. Armstrong, Justine C. Pickarski, Kristen L. Hankins, Emily B. Collier, Maya Shah, Aaron D. Mullen, V. K. Cody Bumgardner

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于AI推理的患者-临床试验匹配系统,通过结构化评估和可解释推理链,提升匹配效率与安全性。

Comments 10 pages, 2 figures, submitted to AMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04478 2025-12-09 cs.AI cs.GT econ.TH 79%

Matching Markets Meet LLMs: Algorithmic Reasoning with Ranked Preferences

匹配市场与大语言模型:基于排名偏好的算法推理

Hadi Hosseini, Samarth Khanna, Ronak Singh

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型在处理基于排名偏好的匹配市场问题时的局限性,发现其在解决大规模不稳定性方面存在不足,并探讨了参数高效微调对小规模市场的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05760 2025-12-08 cs.AI 79%

Evolutionary System 2 Reasoning: An Empirical Proof

进化系统2推理:一个实证证明

Zeyuan Ma, Wenqi Huang, Guo-Huan Song, Hongshu Guo, Sijie Ma, Zhiguang Cao, Yue-Jiao Gong

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出进化推理优化框架,通过进化策略提升LLM的推理能力,实验证实即使弱模型也能通过简单进化获得强大推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04228 2025-12-05 cs.AI 79%

Addressing Logical Fallacies In Scientific Reasoning From Large Language Models: Towards a Dual-Inference Training Framework

解决大型语言模型在科学推理中的逻辑谬误:一种双推理训练框架

Peter B. Walker, Hannah Davidson, Aiden Foster, Matthew Lienert, Thomas Pardue, Dale Russell

机构 * Intelligenesis LLC Uniformed Services University(美国武装部队服务大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种双推理训练框架,旨在解决大型语言模型在科学推理中的逻辑谬误问题,通过整合肯定生成与反事实否定,提升模型的鲁棒性和可解释性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏