arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2604.06401 2026-04-09 cs.AI cs.CE cs.CV cs.LG 76%

ProofSketcher: Hybrid LLM + Lightweight Proof Checker for Reliable Math/Logic Reasoning

ProofSketcher: 混合LLM + 轻量级证明检查器用于可靠的数学/逻辑推理

Kranthi Kommuru, Kunal Khanvilkar, Gaurav Parekh

机构 * Amazon Web Services, Inc(亚马逊云科技)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出混合方法,结合LLM生成类型化证明草图与轻量级可信内核,以提升数学逻辑推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21565 2025-06-30 cs.CL cs.LG stat.ML 76%

A Multi-Agent Probabilistic Inference Framework Inspired by Kairanban-Style CoT System with IdoBata Conversation for Debiasing

Takato Ueno, Keito Inoshita

机构 * Graduate School of Data Science(数据科学研究生院) Faculty of Business(商业学院) Kansai University(关西大学) Research Promotion Center(研究促进中心) Shiga University(守山大学)

专题命中 代码与定理证明 :CoT(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07756 2025-06-16 cs.AI cs.LG cs.MA 76%

Agent Semantics, Semantic Spacetime, and Graphical Reasoning

Mark Burgess

机构 * Mark Burgess

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI、cs.LG

Comments Some typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13631 2025-06-03 cs.AI cs.CL 76%

Mind Your Theory: Theory of Mind Goes Deeper Than Reasoning

Eitan Wagner, Nitay Alon, Joseph M. Barnby, Omri Abend

机构 * Hebrew University of Jerusalem(海法大学) MPI for Biological Cybernetics(生物感知研究所) Centre for AI and Machine Learning, AU(人工智能与机器学习中心) IoPPN, King’s College London(国王学院伦敦人工智能与感知神经科学中心)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI

Comments 4 pages, 2 figures, accepted to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.11360 2020-02-18 cs.LO cs.AI cs.MA math.LO 76%

Automating Agential Reasoning: Proof-Calculi and Syntactic Decidability for STIT Logics

Tim Lyon, Kees van Berkel

专题命中 代码与定理证明 :reasoning(title,comments);分类 cs.AI

Comments Included version of the paper "Automating Agential Reasoning: Proof-Calculi and Syntactic Decidability for STIT Logics", accepted to the 22nd International Conference on Principles and Practice of Multi-Agent Systems (PRIMA 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21678 2026-08-11 cs.LG cs.AI cs.CL 版本更新 75%

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

可解码但不忠实:将自然语言理由与程序化验证器耦合

Vatsal Ananthula, Adarsh Kumarappan

机构 * AI4Math

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出验证器耦合推理框架,通过一致性训练使验证器信息可从理由表示中解码,但发现可解码性不保证忠实生成,在多个任务中验证了该差距。

Comments Accepted to the ICML 2026 AI4Math Workshop as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28215 2026-07-13 cs.AI cs.CL cs.LG cs.LO cs.MA 版本更新 75%

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

解释比单独预测更难:评估基于概念的MLLM解释作为ICL视觉分类器

Carmen Quiles-Ramírez, Leticia L. Rodríguez, Nicolás Martorell, Natalia Díaz-Rodríguez

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过五种形式化程度递增的条件,系统评估多模态大语言模型在少样本上下文学习中的基于概念的可解释性,发现解释比预测更难,且强制生成形式化解释会降低预测准确性。

Comments Accepted to the CompLearn Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16278 2026-06-01 cs.AI cs.CL cs.LG 75%

Learning to Reason with Insight for Informal Theorem Proving

学习在非形式定理证明中进行洞察推理

Yunhe Li, Hao Shi, Bowen Deng, Wei Wang, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Siyang Gao, Chao Wang, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Ke Holdings Inc.(Ke控股公司) Shenzhen University of Advanced Technology(深圳先进技术大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对非形式定理证明中缺乏洞察(识别核心技巧)的瓶颈,提出统一训练框架DeepInsight,通过分层数据集、渐进式多阶段SFT和基于洞察的策略优化方法,显著提升大语言模型的数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08384 2026-02-10 cs.CR 75%

Towards Real-World Industrial-Scale Verification: LLM-Driven Theorem Proving on seL4

迈向现实工业级验证:基于LLM的定理证明在seL4上的应用

Jianyu Zhang, Fuyuan Zhang, Jiayi Lu, Jilin Hu, Xiaoyi Yin, Long Zhang, Feng Yang, Yongwang Zhao

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出AutoReal,一种基于LLM的工业级定理证明方法,通过轻量级本地部署和改进的证明训练,实现了在seL4验证项目中51.67%的证明成功率,并在其他安全项目中达到53.88%的证明成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13139 2025-11-18 cs.AR 75%

Think with Self-Decoupling and Self-Verification: Automated RTL Design with Backtrack-ToT

Zhiteng Chao, Yonghao Wang, Xinyu Zhang, Jiaxin Zhou, Tenghui Hua, Husheng Han, Tianmeng Yang, Jianan Mu, Bei Yu, Rui Zhang, Jing Ye, Huawei Li

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23674 2025-09-30 cs.AR 75%

AssertGen: Enhancement of LLM-aided Assertion Generation through Cross-Layer Signal Bridging

Hongqin Lyu, Yonghao Wang, Yunlin Du, Mingyu Shi, Zhiteng Chao, Wenxing Li, Tiancheng Wang, Huawei Li

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05411 2024-07-09 cs.SE 75%

Assessing Code Generation with Intermediate Languages

Xun Deng, Sicheng Zhong, Honghua Dong, Jingyu Hu, Sidi Mohamed Beillahi, Xujie Si, Fan Long

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07496 2024-06-12 cs.CL cs.AI cs.LG 75%

TextGrad: Automatic "Differentiation" via Text

Mert Yuksekgonul, Federico Bianchi, Joseph Boen, Sheng Liu, Zhi Huang, Carlos Guestrin, James Zou

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05566 2024-01-19 cs.CR cs.AI cs.CL cs.LG cs.SE 75%

Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

Evan Hubinger, Carson Denison, Jesse Mu, Mike Lambert, Meg Tong, Monte MacDiarmid, Tamera Lanham, Daniel M. Ziegler, Tim Maxwell, Newton Cheng, Adam Jermyn, Amanda Askell, Ansh Radhakrishnan, Cem Anil, David Duvenaud, Deep Ganguli, Fazl Barez, Jack Clark, Kamal Ndousse, Kshitij Sachan, Michael Sellitto, Mrinank Sharma, Nova DasSarma, Roger Grosse, Shauna Kravec, Yuntao Bai, Zachary Witten, Marina Favaro, Jan Brauner, Holden Karnofsky, Paul Christiano, Samuel R. Bowman, Logan Graham, Jared Kaplan, Sören Mindermann, Ryan Greenblatt, Buck Shlegeris, Nicholas Schiefer, Ethan Perez

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments updated to add missing acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.14786 2020-10-22 cs.LG cs.AI cs.CL stat.ML 75%

Measuring Systematic Generalization in Neural Proof Generation with Transformers

Nicolas Gontier, Koustuv Sinha, Siva Reddy, Christopher Pal

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2020; 17 pages; 9 figures; 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04457 2026-08-19 cs.DB cs.AI cs.LO 版本更新 74%

Eigenius: A Typed Knowledge-Graph DBMS with Epistemic Stratification and Institution-Mediated Reasoning

Eigenius:具备认知分层与机构介导推理的类型化知识图数据库管理系统

Hans-Martin Will, Allen L. Brown, Matthew Fuchs

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 Eigenius是一款开源类型化知识图DBMS,通过耦合类型系统等实现数据溯源不变,统一科学认识论,在Nature研究复现中验证了52个结论并发现4处差异。

Comments Minor corrections to the previous version of the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06757 2026-07-09 cs.AI cs.MA 新提交 74%

LLM-powered reasoning in agent-based modeling

基于代理建模中的大语言模型驱动推理

Sifat Afroj Moon, Dakotah Maguire, Adam Spannaus, Joe Tuccillo, Maksudul Alam, Sudip K. Seal, John Gounley, Heidi Hanson

机构 * ORNL(橡树岭国家实验室)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 研究针对传统基于代理建模(ABM)依赖静态先验无法适应实时变化的问题,提出利用大语言模型(LLMs)的可扩展混合代理和语言驱动的流行病(HALE)建模框架,并通过模拟COVID-19验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29277 2026-05-29 cs.SE cs.AI 74%

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA

Code-QA-Bench:在仓库级问答中分离代码推理与文档记忆

Jun Zhang, JianYing Qu, Hanwen Du, Zhongkai Sun, Yehua Yang, Qiao Zhao

机构 * Baidu Inc(百度公司)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 提出Code-QA-Bench框架,通过答案优先生成和三条件实验设计,自动构建仓库级代码理解基准,以区分代码推理、文档回忆和预训练记忆的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20179 2026-04-23 cs.CR cs.AI cs.SE 74%

Taint-Style Vulnerability Detection and Confirmation for Node.js Packages Using LLM Agent Reasoning

基于LLM代理推理的Node.js包污点式漏洞检测与验证

Ronghao Ni, Mihai Christodorescu, Limin Jia

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 本文提出LLMVD.js,通过LLM代理实现Node.js包的污点式漏洞检测与验证,有效率达84%,优于传统方法,无需注解或报告。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11206 2026-04-14 cs.SE cs.AI 74%

Designing Adaptive Digital Nudging Systems with LLM-Driven Reasoning

基于LLM驱动推理的自适应数字引导系统设计

Tiziano Santilli, Mina Alipour, Mahyar Tourchi Moghaddam

机构 * Syddansk Universitet(南丹麦大学)

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

AI总结 本文提出一种将行为科学与软件设计结合的自适应数字引导系统架构,通过整合多维用户建模与伦理合规,验证了其在住宅能源可持续性中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00998 2026-02-03 cs.CL 74%

Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning

通过资格推理和面向节段的强化学习可靠地使用引理

Zhikun Xu, Xiaodong Yu, Ben Zhou, Jiang Liu, Jialian Wu, Ze Wang, Ximeng Sun, Hao Chen, Zicheng Liu

机构 * Arizona State University(亚利桑那州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL

AI总结 通过资格推理和面向节段的强化学习提升LLM在数学引理应用的可靠性与鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03469 2025-11-25 cs.AI cs.LO 74%

Bridging LLM Planning Agents and Formal Methods: A Case Study in Plan Verification

连接大语言模型规划代理与形式方法:计划验证的案例研究

Keshav Ramani, Vali Tawosi, Salwa Alamir, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 代码与定理证明 :planning(title);分类 cs.AI

AI总结 本文提出一种利用大语言模型将自然语言计划转换为形式化逻辑并进行验证的框架,展示了GPT-5在计划验证中的高准确率及形式化表示的生成能力。

Comments Accepted to AgenticSE Workshop at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00202 2025-11-04 cs.SE cs.LG cs.LO 74%

Position: Vibe Coding Needs Vibe Reasoning: Improving Vibe Coding with Formal Verification

Jacqueline Mitchell, Yasser Shaaban

机构 * University of Southern California(南加州大学)

专题命中 代码与定理证明 :reasoning(title);分类 cs.LG

Comments 7 pages, 3 figures, In Proceedings of the 1st ACM SIGPLAN International Workshop on Language Models and Programming Languages (LMPL'25), October 12-18, 2025, Singapore, Singapore. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16322 2025-07-23 cs.AI 74%

Mind the Gap: Evaluating the Representativeness of Quantitative Medical Language Reasoning LLM Benchmarks for African Disease Burdens

Fred Mutisya, Shikoh Gitau, Christine Syovata, Diana Oigara, Ibrahim Matende, Muna Aden, Munira Ali, Ryan Nyotu, Diana Marion, Job Nyangena, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha, Eric Mibuari, Jean Philbert Nsengemana, Talkmore Chidede

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

Comments Preprint. 26 pages, includes appendix and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.07648 2021-05-27 cs.AI cs.LO cs.MA 74%

A Formal Framework for Reasoning about Agents' Independence in Self-organizing Multi-agent Systems

Jieting Luo, Beishui Liao, John-Jules Meyer

专题命中 代码与定理证明 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28841 2026-06-30 cs.LO cs.AI cs.CL 73%

LAMP: Lean-based Agentic framework with MCP and Proof Repair

LAMP: 基于 Lean 的 MCP 与证明修复智能体框架

Santhana Srinivasan R, Maithilee Patawar

机构 * Indian Institute of Information Technology, Design and Manufacturing, Kancheepuram(印度信息与设计制造理工学院,卡纳切普拉姆)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出 LAMP 多智能体框架,通过推理时提供结构化领域知识(本体)而非微调,在 Lean 4 中合成内核验证的证明,在组合学词领域定理上达到 96.7% 的验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23972 2026-05-26 cs.AI cs.CL cs.RO 73%

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

为什么我们需要世界模型来实现通用人工智能:大语言模型失败之处以及世界模型如何可能超越

Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal, Poovammal E, Talal Bonny

机构 * Department of Computing Technologies(计算技术系) SRM Institute of Science and Technology(SRM科学与技术学院) Bio-Sensing and Bio-Sensors Group(生物传感与生物传感器组) Smart Automation and Communication Technologies Research Institute of Sciences and Engineering(科学与工程智能自动化与通信技术研究所) University of Sharjah, UAE(阿联酋沙迦大学) Department of Computer Engineering(计算机工程系) College of Computing and Informatics(计算与信息学院)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提出潜在动态推理(LDI)概念和Flux环境案例研究,论证了大语言模型在因果推理、状态跟踪和长程规划上的局限性,并展示基于显式状态空间的强化学习智能体在长程游戏中显著优于纯文本LLM。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20134 2026-04-23 cs.CR cs.AI cs.CL 73%

AgentSOC: A Multi-Layer Agentic AI Framework for Security Operations Automation

AgentSOC: 一种多层代理AI框架用于安全运营自动化

Joyjit Roy, Samaresh Kumar Singh

机构 * IEEE

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 AgentSOC通过整合感知、前瞻性推理和基于风险的行动规划,提升安全运营中心自动化水平,实现警报标准化、上下文丰富化及安全响应合规性。

Comments 7 pages, 6 figures, 2 tables. Peer-reviewed paper published in IEEE ICAIC 2026 (IEEE Xplore)

Journal ref 2026 IEEE 5th International Conference on AI in Cybersecurity (ICAIC), Houston, TX, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 73%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02454 2025-12-16 cs.CL cs.AI 73%

Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework

多模态深度研究员:从零开始生成文本-图表交织报告的代理框架

Zhaorui Yang, Bo Pan, Han Wang, Yiyao Wang, Xingyu Liu, Luoxuan Weng, Yingchaojie Feng, Haozhe Feng, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 多模态深度研究员通过代理框架实现从零开始生成文本-图表交织报告,利用FDV结构化文本表示提升可视化生成质量。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏