arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2511.21033 2026-03-06 cs.AI 79%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01012 2026-03-04 cs.SE cs.AI 79%

FastCode: Fast and Cost-Efficient Code Understanding and Reasoning

FastCode: 快速且成本有效的代码理解和推理

Zhonghang Li, Zongwei Li, Yuxuan Chen, Han Shi, Jiawei Li, Jierun Chen, Haoli Bai, Chao Huang

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 FastCode通过结构化勘探机制提升代码推理效率,减少计算成本,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20973 2026-02-25 cs.CL 79%

Linear Reasoning vs. Proof by Cases: Obstacles for Large Language Models in FOL Problem Solving

线性推理与证明中的反证法:大型语言模型在一阶逻辑问题解决中的障碍

Yuliang Ji, Fuchen Shen, Jian Wu, Qiujie Xie, Yue Zhang

机构 * Nanjing University of Science and Technology(南京理工大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出PC-FOL数据集,通过对比线性推理与基于情况的推理,揭示大型语言模型在FOL问题解决中的核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07443 2026-02-17 cs.AI cs.GT 79%

Approximating Human Strategic Reasoning with LLM-Enhanced Recursive Reasoners Leveraging Multi-agent Hypergames

用LLM增强的递归推理器近似人类战略推理

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

机构 * Royal Holloway University of London(伦敦皇家霍洛威大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM增强的递归推理器框架,通过多智能体超游戏模型评估LLM的递归推理能力,并展示了其在近似人类行为和最优解达成方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18880 2026-01-27 cs.AI 79%

Challenges for Generative AI in Legal Reasoning

生成AI在法律推理中的挑战

Eljas Linna, Tuula Linna

机构 * Tampere University(塔尔库大学) University of Helsinki(赫尔辛基大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文探讨了生成AI在法律推理中的关键挑战,分析了现有AI技术在处理法律问题中的局限性,并提出分阶段采用技术以提升法律推理的严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14027 2026-01-21 cs.AI 79%

Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics

Numina-Lean-Agent: 一种面向形式数学的开放且通用的代理推理系统

Junqi Liu, Zihao Zhou, Zekai Zhu, Marco Dos Santos, Weikun He, Jiawei Liu, Ran Wang, Yunzhou Xie, Junqiao Zhao, Qiufeng Wang, Lihong Zhi, Jia Li, Wenda Li

机构 * Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Tongji University(同济大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Liverpool(利物浦大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 Numina-Lean-Agent通过通用编码代理实现形式数学推理,解决Putnam 2025全部问题并成功形式化Brascamp-Lieb定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08710 2026-01-21 cs.CL 79%

Thinking Longer, Not Always Smarter: Evaluating LLM Capabilities in Hierarchical Legal Reasoning

深入思考,而非总是更聪明:评估大语言模型在分层法律推理中的能力

Li Zhang, Matthias Grabmair, Morgan Gray, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一个框架评估大语言模型在分层法律推理中的能力,发现模型在表面推理准确但分层推理表现下降,揭示了模型在复杂领域中的局限性。

Comments 15 pages, 7 figures, Proceedings of the 2026 Symposium on Computer Science and Law (CSLAW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05269 2026-01-21 cs.SE cs.AI 79%

CoRe: Benchmarking LLMs Code Reasoning Capabilities through Static Analysis Tasks

CoRe:通过静态分析任务基准测试LLM的代码推理能力

Danning Xie, Mingwei Zheng, Xuwei Liu, Jiannan Wang, Chengpeng Wang, Lin Tan, Xiangyu Zhang

机构 * Department of Computer Science Purdue University(计算机科学系 帕克森大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 CoRe通过静态分析任务评估LLM的代码推理能力,发现主流模型在深层次语义理解和多步骤推理上存在不足。

Comments NeurIPS 2025 Datasets & Benchmarks Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03731 2026-01-12 cs.SE cs.AI 79%

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

从实验室到现实应用:在仓库级别评估代理代码推理

Jia Li, Yuxin Su, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13725 2025-12-25 cs.AI 79%

Compressed Causal Reasoning: Quantization and GraphRAG Effects on Interventional and Counterfactual Accuracy

压缩因果推理:量化与图RAG对干预和反事实准确率的影响

Steve Nwaiwu, Nipat Jongsawat, Anucha Tungkasthan

机构 * School of Data and Information(数据与信息学院) Rajamangala University of Technology(拉贾穆angala技术大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨量化与图结构增强对因果推理准确率的影响,发现四比特量化对因果推理具有鲁棒性,图结构增强可提升干预准确性,现有反事实基准需改进以捕捉更深层次因果脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16958 2025-12-23 cs.AI 79%

Quantum Abduction: A New Paradigm for Reasoning under Uncertainty

量子反向推理:一种在不确定性下推理的新范式

Remo Pareschi

机构 * Stake Lab, University of Molise(斯泰克实验室,莫利塞大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 量子反向推理通过非经典范式模拟人类在不确定性下的多线索推理,实现动态综合而非排除,适用于历史谜团、文学、医学和科学理论变革等领域。

Comments 23 pages, 8 figures, 3 tables; submitted to Sci, MDPI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19942 2025-12-12 cs.LG 79%

Differential Smoothing Mitigates Sharpening and Improves LLM Reasoning

微分平滑缓解锐化并提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Huaqing Zhang, Aditi Raghunathan

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

AI总结 微分平滑通过缓解RL微调中的锐化问题,提升大语言模型的推理能力和输出多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15257 2025-12-12 cs.CL 79%

When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners

当语言更少时更有效:语言推理解耦使LLM成为更好的多语言推理者

Weixiang Zhao, Jiahe Guo, Yang Deng, Tongtong Wu, Wenxuan Zhang, Yulin Hu, Xingyu Sui, Yanyan Zhao, Wanxiang Che, Bing Qin, Tat-Seng Chua, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理学院) Monash University(墨尔本大学) Singapore University of Technology and Design(新加坡科技设计大学) National University of Singapore(国立新加坡大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 通过解耦语言和推理能力,使LLM在多语言推理中表现更优,无需额外训练开销。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08026 2025-12-10 cs.AI 79%

Toward an AI Reasoning-Enabled System for Patient-Clinical Trial Matching

迈向基于AI推理的患者-临床试验匹配系统

Caroline N. Leach, Mitchell A. Klusty, Samuel E. Armstrong, Justine C. Pickarski, Kristen L. Hankins, Emily B. Collier, Maya Shah, Aaron D. Mullen, V. K. Cody Bumgardner

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于AI推理的患者-临床试验匹配系统,通过结构化评估和可解释推理链,提升匹配效率与安全性。

Comments 10 pages, 2 figures, submitted to AMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04478 2025-12-09 cs.AI cs.GT econ.TH 79%

Matching Markets Meet LLMs: Algorithmic Reasoning with Ranked Preferences

匹配市场与大语言模型:基于排名偏好的算法推理

Hadi Hosseini, Samarth Khanna, Ronak Singh

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型在处理基于排名偏好的匹配市场问题时的局限性,发现其在解决大规模不稳定性方面存在不足,并探讨了参数高效微调对小规模市场的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05760 2025-12-08 cs.AI 79%

Evolutionary System 2 Reasoning: An Empirical Proof

进化系统2推理:一个实证证明

Zeyuan Ma, Wenqi Huang, Guo-Huan Song, Hongshu Guo, Sijie Ma, Zhiguang Cao, Yue-Jiao Gong

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出进化推理优化框架,通过进化策略提升LLM的推理能力,实验证实即使弱模型也能通过简单进化获得强大推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04228 2025-12-05 cs.AI 79%

Addressing Logical Fallacies In Scientific Reasoning From Large Language Models: Towards a Dual-Inference Training Framework

解决大型语言模型在科学推理中的逻辑谬误:一种双推理训练框架

Peter B. Walker, Hannah Davidson, Aiden Foster, Matthew Lienert, Thomas Pardue, Dale Russell

机构 * Intelligenesis LLC Uniformed Services University(美国武装部队服务大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种双推理训练框架,旨在解决大型语言模型在科学推理中的逻辑谬误问题,通过整合肯定生成与反事实否定,提升模型的鲁棒性和可解释性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16292 2025-11-21 cs.AI 79%

Distributed Agent Reasoning Across Independent Systems With Strict Data Locality

跨独立系统的分布式代理推理与严格数据本地性

Daniel Vaughan, Kateřina Vaughan

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于自然语言消息的分布式代理推理系统,通过伪匿名令牌和本地数据查询实现跨组织安全合作,验证了去中心化多代理系统的可行性。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26546 2025-11-17 cs.SE cs.LG 79%

Towards Verified Code Reasoning by LLMs

Meghana Sistla, Gogul Balakrishnan, Pat Rondon, José Cambronero, Michele Tufano, Satish Chandra

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google DeepMind(谷歌DeepMind) Google(谷歌) Meta Platforms(元平台)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08392 2025-11-12 cs.CL 79%

PCRLLM: Proof-Carrying Reasoning with Large Language Models under Stepwise Logical Constraints

Tangrui Li, Pei Wang, Hongzheng Wang Christian Hahm, Matteo Spatola, Justin Shi

机构 * Temple University(特拉华大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14758 2025-11-11 cs.CL 79%

Reasoning with Exploration: An Entropy Perspective

Daixuan Cheng, Shaohan Huang, Xuekai Zhu, Bo Dai, Wayne Xin Zhao, Zhenliang Zhang, Furu Wei

机构 * RUC(北京理工大学) MSRA(微软研究院) SJTU(上海交通大学) BIGAI(北京人工智能研究院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

Comments AAAI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05758 2025-11-05 cs.AI cs.LO 79%

APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning

Azim Ospanov, Farzan Farnia, Roozbeh Yousefzadeh

机构 * Huawei Hong Kong Research Center(华为香港研究中心) Department of Computer Science & Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02197 2025-11-05 cs.SE cs.AI 79%

Open the Oyster: Empirical Evaluation and Improvement of Code Reasoning Confidence in LLMs

Shufan Wang, Xing Hu, Junkai Chen, Zhiyuan Pan, Xin Xia

机构 * Singapore Management University(新加坡国立管理学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00488 2025-11-04 cs.PL cs.CL 79%

\texttt{ReMind}: Understanding Deductive Code Reasoning in LLMs

Jun Gao, Yun Peng, Xiaoxue Ren

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27448 2025-11-03 cs.AI 79%

GeoFM: Enhancing Geometric Reasoning of MLLMs via Synthetic Data Generation through Formal Language

Yuhao Zhang, Dingxin Hu, Tinghao Yu, Hao Liu, Yiting Liu

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25623 2025-10-31 cs.CL 79%

Evaluating the Role of Verifiers in Test-Time Scaling for Legal Reasoning Tasks

Davide Romano, Jonathan Schwarz, Daniele Giofré

机构 * Thomson Reuters(汤姆森·路透)

专题命中 代码与定理证明 :reasoning(title);verifier(abstract);分类 cs.CL

Comments Accepted to EMNLP - NLLP Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16614 2025-10-24 cs.AI 79%

Count Counts: Motivating Exploration in LLM Reasoning with Count-based Intrinsic Rewards

Xuan Zhang, Ruixiao Li, Zhijian Zhou, Long Li, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25282 2025-10-09 cs.AI cs.HC cs.SE 79%

Toward Causal-Visual Programming: Enhancing Agentic Reasoning in Low-Code Environments

Jiexi Xu, Jiaqi Liu, Lanruo Wang, Su Liu

机构 * School of Information \& Computer Science University of California, Irvine Irvine, CA, USA Independent Researcher University of Texas at Dallas Dallas, TX, USA Georgia Institute of Technology Atlanta, GA, USA

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

Comments 5 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12686 2025-10-01 cs.LG cs.PL cs.SE 79%

Understanding Formal Reasoning Failures in LLMs as Abstract Interpreters

Jacqueline L. Mitchell, Brian Hyeongseok Kim, Chenyu Zhou, Chao Wang

机构 * University of Southern California(南加州大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10898 2025-09-22 cs.CR cs.AI cs.SE 79%

MalCodeAI: Autonomous Vulnerability Detection and Remediation via Language Agnostic Code Reasoning

Jugal Gajjar, Kamalasankari Subramaniakuppusamy, Noha El Kachach

机构 * Computer Science Department(计算机科学系) The George Washington University(乔治华盛顿大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

Comments 6 pages, 4 figures, accepted for publication in IEEE 26th International Conference on Information Reuse and Integration (IRI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏