arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-15 至 2026-07-15 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 4 篇

2607.12733 2026-07-15 cs.AI cs.LG 新提交 81%

LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos

大语言模型能看到烟雾却看不到火焰:用Elenchos评估溯因推理

Julius Steiglechner, Lucas Mahler, Gabriele Lohmann

机构 * Max-Planck-Institute for Biological Cybernetics(马克斯·普朗克生物控制论研究所) University Hospital Tübingen(图宾根大学医院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型的溯因推理能力,引入Elenchos评估框架,通过给定形式系统及变异对应物,让智能体判断变异并推断规则修改,发现模型存在检测-归因分离问题,相互作用变异下性能降,推理时间收益递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12650 2026-07-15 cs.LG cs.AI cs.CY cs.SE 新提交 81%

Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs

基于证据的可验证智能推理:通过工具验证内核证明消除经验推理中语言模型幻觉的途径

Junyu Ren

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在消除语言模型经验推理中的幻觉,提出基于Lean 4的EG-VAR工具调用架构,通过工具验证公理等生成可验证声明,经实验在数值推理等测试中表现良好,定位为高风险经验声明的技术治理接口,可审计相关条件并转化错误为审计目标。

Comments Accepted at the ICML 2026 TAIGR workshop. System name: EG-VAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09008 2026-07-15 cs.CL cs.AI cs.LG cs.LO 版本更新 67%

A Neurosymbolic Approach to Natural Language Formalization and Verification

一种用于自然语言形式化和验证的神经符号方法

Chenyang An, Sam Bayless, Stefano Buliani, Darion Cassel, Byron Cook, Duncan Clough, Rémi Delmas, Nafi Diallo, Ferhat Erata, Nick Feng, Dimitra Giannakopoulou, Aman Goel, Aditya Gokhale, Joe Hendrix, Victor Heorhiadi, Marc Hudak, Dejan Jovanović, Andrew M. Kent, Benjamin Kiesl-Reiter, Jeffrey J. Kuna, Nadia Labai, Joseph Lilien, Divya Raghunathan, Zvonimir Rakamarić, Niloofar Razavi, Michael Tautschnig, Ali Torkamani, Nathaniel Weir, Michael W. Whalen, Jianan Yao

机构 * Amazon Web Services(亚马逊网络服务) University College London(伦敦大学学院) University of Toronto(多伦多大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05820 2026-07-15 cs.SE 版本更新 50%

SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis

通过负测试作为完整性信号的强化学习用于形式规范综合

Zhechong Huang, Zhao Zhang, Zeyu Sun, Huifeng Sun, Yingfei Xiong

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏