arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2602.13574 2026-02-17 cs.SE cs.CR 78%

Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation

面向执行状态的LLM推理用于自动化漏洞证明生成

Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, Luyi Xing

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。

Comments Version 1.0 (13 pages, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO 78%

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17548 2025-07-24 cs.SE 78%

CodeReasoner: Enhancing the Code Reasoning Ability with Reinforcement Learning

Lingxiao Tang, He Ye, Zhongxin Liu, Xiaoxue Ren, Lingfeng Bao

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13487 2024-10-18 cs.CE 78%

Automated Reasoning in Systems Biology: a Necessity for Precision Medicine

Pedro Zuidberg Dos Martires, Vincent Derkinderen, Luc De Raedt, Marcus Krantz

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10186 2024-09-20 cs.NI 78%

Toward Explainable Reasoning in 6G: A Proof of Concept Study on Radio Resource Allocation

Farhad Rezazadeh, Sergio Barrachina-Muñoz, Hatim Chergui, Josep Mangues, Mehdi Bennis, Dusit Niyato, Houbing Song, Lingjia Liu

专题命中 代码与定理证明 :reasoning(title,abstract)

Comments 21 pages, 11 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.10363 2018-12-27 cs.LO 78%

Reasoning About Safety-Critical Information Flow Between Pilot and Computer

Seth Ahrenbach

专题命中 代码与定理证明 :reasoning(title,abstract)

Comments Published in the Proceedings from the 9th International Symposium of NASA Formal Methods, 2017

Journal ref In: Barrett C., Davies M., Kahsai T. (eds) NASA Formal Methods. NFM 2017. Lecture Notes in Computer Science, vol 10227. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
1102.3341 2011-04-29 cs.MA 78%

Reasoning about Social Choice Functions

Nicolas Troquard, Wiebe van der Hoek, Michael Wooldridge

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 77%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00003 2025-12-03 cs.CC cs.DS cs.LG 77%

Efficient Turing Machine Simulation with Transformers

基于变压器的高效图灵机模拟

Qian Li, Yuyi Wang

机构 * Shenzhen International Center For Industrial And Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) CRRC Zhuzhou Institute(CRRC 长沙研究所) Tengen Intelligence Institute(腾根智能研究院)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出了一种基于变压器的高效图灵机模拟方法,通过优化上下文窗口和CoT步骤,实现了更高效的通用计算。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18883 2025-11-10 cs.AI 77%

Introducing LongCat-Flash-Thinking: A Technical Report

Meituan LongCat Team, Anchun Gui, Bei Li, Bingyang Tao, Bole Zhou, Borun Chen, Chao Zhang, Chao Zhang, Chengcheng Han, Chenhui Yang, Chi Zhang, Chong Peng, Chuyu Zhang, Cong Chen, Fengcun Li, Gang Xu, Guoyuan Lin, Hao Jiang, Hao Liang, Haomin Fu, Haoxiang Ma, Hong Liu, Hongyan Hao, Hongyin Tang, Hongyu Zang, Hongzhi Ni, Hui Su, Jiahao Liu, Jiahuan Li, Jialin Liu, Jianfei Zhang, Jianhao Xu, Jianing Wang, Jiaqi Sun, Jiaqi Zhang, Jiarong Shi, Jiawei Yang, Jingang Wang, Jinrui Ding, Jun Kuang, Jun Xu, Ke He, Kefeng Zhang, Keheng Wang, Keqing He, Li Wei, Liang Shi, Lin Qiu, Lingbin Kong, Lingchuan Liu, Linsen Guo, Longfei An, Mai Xia, Meng Zhou, Mengshen Zhu, Peng Pei, Pengcheng Jia, Qi Gu, Qi Guo, Qiong Huang, Quan Chen, Quanchi Weng, Rongxiang Weng, Ruichen Shao, Rumei Li, Shanglin Lei, Shuai Du, Shuaikang Liu, Shuang Zhou, Shuhao Hu, Siyu Xu, Songshan Gong, Tao Liang, Tianhao Hu, Wei He, Wei Shi, Wei Wang, Wei Wu, Wei Zhuo, Weifeng Tang, Wenjie Shi, Wenlong Zhu, Xi Su, Xiangcheng Liu, Xiangyu Xi, Xiangzhou Huang, Xiao Liu, Xiaochen Jiang, Xiaowei Shi, Xiaowen Shi, Xiaoyu Li, Xin Chen, Xinyue Zhao, Xuan Huang, Xuemiao Zhang, Xuezhi Cao, Xunliang Cai, Yajie Zhang, Yang Chen, Yang Liu, Yang Liu, Yang Zheng, Yaoming Wang, Yaqi Huo, Yerui Sun, Yifan Lu, Yiyang Li, Youshao Xiao, Yuanzhe Lei, Yuchen Xie, Yueqing Sun, Yufei Zhang, Yuhuai Wei, Yulei Qian, Yunke Zhao, Yuqing Ding, Yuwei Jiang, Zhaohua Yang, Zhengyu Chen, Zhijian Liu, Zhikang Xia, Zhongda Su, Ziran Li, Ziwen Wang, Ziyuan Zhuang, Zongyu Wang, Zunyuan Yang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06736 2025-10-31 cs.CL 77%

Are LLMs Rigorous Logical Reasoners? Empowering Natural Language Proof Generation by Stepwise Decoding with Contrastive Learning

Ying Su, Mingwen Liu, Zhijiang Guo

机构 * South China University of Technology(华南理工大学) Likelihood Lab(Likelihood实验室) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL

Comments 15 pages, 2 figures, 11 tables. Accepted by AACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02318 2025-01-06 cs.SE cs.AI cs.LO cs.PL 77%

Evaluating the Ability of Large Language Models to Generate Verifiable Specifications in VeriFast

Wen Fan, Marilyn Rego, Xin Hu, Sanya Dod, Zhaorui Ni, Danning Xie, Jenna DiVincenzo, Lin Tan

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13353 2026-07-14 cs.CL cs.LG cs.SE 版本更新 76%

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding

感知与敏感性:探讨语义回忆对长上下文代码推理的影响

Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06401 2026-04-09 cs.AI cs.CE cs.CV cs.LG 76%

ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning

ProofSketcher: 混合LLM + 轻量级证明检查器用于可靠的数学/逻辑推理

Kranthi Kommuru, Kunal Khanvilkar, Gaurav Parekh

机构 * Amazon Web Services, Inc(亚马逊云科技)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出混合方法,结合LLM生成类型化证明草图与轻量级可信内核,以提升数学逻辑推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21565 2025-06-30 cs.CL cs.LG stat.ML 76%

A Multi-Agent Probabilistic Inference Framework Inspired by Kairanban-Style CoT System with IdoBata Conversation for Debiasing

Takato Ueno, Keito Inoshita

机构 * Graduate School of Data Science(数据科学研究生院) Faculty of Business(商业学院) Kansai University(关西大学) Research Promotion Center(研究促进中心) Shiga University(守山大学)

专题命中 代码与定理证明 :CoT(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07756 2025-06-16 cs.AI cs.LG cs.MA 76%

Agent Semantics, Semantic Spacetime, and Graphical Reasoning

Mark Burgess

机构 * Mark Burgess

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

Comments Some typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13631 2025-06-03 cs.AI cs.CL 76%

Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning

Eitan Wagner, Nitay Alon, Joseph M. Barnby, Omri Abend

机构 * Hebrew University of Jerusalem(海法大学) MPI for Biological Cybernetics(生物感知研究所) Centre for AI and Machine Learning, AU(人工智能与机器学习中心) IoPPN, King’s College London(国王学院伦敦人工智能与感知神经科学中心)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI

Comments 4 pages, 2 figures, accepted to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11360 2020-02-18 cs.LO cs.AI cs.MA math.LO 76%

Automating Agential Reasoning: Proof-Calculi and Syntactic Decidability for STIT Logics

Tim Lyon, Kees van Berkel

专题命中 代码与定理证明 :reasoning(title,comments);分类 cs.AI

Comments Included version of the paper "Automating Agential Reasoning: Proof-Calculi and Syntactic Decidability for STIT Logics", accepted to the 22nd International Conference on Principles and Practice of Multi-Agent Systems (PRIMA 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21678 2026-08-11 cs.LG cs.AI cs.CL 版本更新 75%

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

可解码但不忠实:将自然语言理由与程序化验证器耦合

Vatsal Ananthula, Adarsh Kumarappan

机构 * AI4Math

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出验证器耦合推理框架,通过一致性训练使验证器信息可从理由表示中解码,但发现可解码性不保证忠实生成,在多个任务中验证了该差距。

Comments Accepted to the ICML 2026 AI4Math Workshop as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 75%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16278 2026-06-01 cs.AI cs.CL cs.LG 75%

Learning to Reason with Insight for Informal Theorem Proving

学习在非形式定理证明中进行洞察推理

Yunhe Li, Hao Shi, Bowen Deng, Wei Wang, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Siyang Gao, Chao Wang, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Ke Holdings Inc.(Ke控股公司) Shenzhen University of Advanced Technology(深圳先进技术大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对非形式定理证明中缺乏洞察(识别核心技巧)的瓶颈,提出统一训练框架DeepInsight,通过分层数据集、渐进式多阶段SFT和基于洞察的策略优化方法,显著提升大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08384 2026-02-10 cs.CR 75%

Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4

迈向现实工业级验证:基于LLM的定理证明在seL4上的应用

Jianyu Zhang, Fuyuan Zhang, Jiayi Lu, Jilin Hu, Xiaoyi Yin, Long Zhang, Feng Yang, Yongwang Zhao

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AutoReal,一种基于LLM的工业级定理证明方法,通过轻量级本地部署和改进的证明训练,实现了在seL4验证项目中51.67%的证明成功率,并在其他安全项目中达到53.88%的证明成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13139 2025-11-18 cs.AR 75%

Think with Self-Decoupling and Self-Verification: Automated RTL Design with Backtrack-ToT

Zhiteng Chao, Yonghao Wang, Xinyu Zhang, Jiaxin Zhou, Tenghui Hua, Husheng Han, Tianmeng Yang, Jianan Mu, Bei Yu, Rui Zhang, Jing Ye, Huawei Li

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23674 2025-09-30 cs.AR 75%

AssertGen: Enhancement of LLM-aided Assertion Generation through Cross-Layer Signal Bridging

Hongqin Lyu, Yonghao Wang, Yunlin Du, Mingyu Shi, Zhiteng Chao, Wenxing Li, Tiancheng Wang, Huawei Li

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05411 2024-07-09 cs.SE 75%

Assessing Code Generation with Intermediate Languages

Xun Deng, Sicheng Zhong, Honghua Dong, Jingyu Hu, Sidi Mohamed Beillahi, Xujie Si, Fan Long

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07496 2024-06-12 cs.CL cs.AI cs.LG 75%

TextGrad: Automatic "Differentiation" via Text

Mert Yuksekgonul, Federico Bianchi, Joseph Boen, Sheng Liu, Zhi Huang, Carlos Guestrin, James Zou

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05566 2024-01-19 cs.CR cs.AI cs.CL cs.LG cs.SE 75%

Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Evan Hubinger, Carson Denison, Jesse Mu, Mike Lambert, Meg Tong, Monte MacDiarmid, Tamera Lanham, Daniel M. Ziegler, Tim Maxwell, Newton Cheng, Adam Jermyn, Amanda Askell, Ansh Radhakrishnan, Cem Anil, David Duvenaud, Deep Ganguli, Fazl Barez, Jack Clark, Kamal Ndousse, Kshitij Sachan, Michael Sellitto, Mrinank Sharma, Nova DasSarma, Roger Grosse, Shauna Kravec, Yuntao Bai, Zachary Witten, Marina Favaro, Jan Brauner, Holden Karnofsky, Paul Christiano, Samuel R. Bowman, Logan Graham, Jared Kaplan, Sören Mindermann, Ryan Greenblatt, Buck Shlegeris, Nicholas Schiefer, Ethan Perez

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments updated to add missing acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.14786 2020-10-22 cs.LG cs.AI cs.CL stat.ML 75%

Measuring Systematic Generalization in Neural Proof Generation with Transformers

Nicolas Gontier, Koustuv Sinha, Siva Reddy, Christopher Pal

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2020; 17 pages; 9 figures; 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04457 2026-08-06 cs.DB cs.AI cs.LO 新提交 74%

Eigenius: A Typed Knowledge-Graph DBMS with Epistemic Stratification and Institution-Mediated Reasoning

Eigenius:具备认知分层与机构介导推理的类型化知识图数据库管理系统

Hans-Martin Will, Allen L. Brown, Matthew Fuchs

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 Eigenius是一款开源类型化知识图DBMS,通过耦合类型系统等实现数据溯源不变,统一科学认识论,在Nature研究复现中验证了52个结论并发现4处差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06757 2026-07-09 cs.AI cs.MA 新提交 74%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏