arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-26 至 2026-06-26 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 3 篇

2606.26857 2026-06-26 cs.AI 新提交 57%

LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation

LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估

Georgios Tsironis, Juan D. Medrano-Garcia, Gonzalo Guillen-Gosalbez

机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) NCCR Catalysis(瑞士国家研究能力中心催化研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。

Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26490 2026-06-26 cs.SE cs.AI cs.LO cs.PL 新提交 57%

An Empirical Study of LLM-Generated Specifications for VeriFast

LLM 生成的 VeriFast 规范实证研究

Wen Fan, Minh Tran, Sanya Dod, Xin Hu, Marilyn Rego, Danning Xie, Jenna DiVincenzo, Lin Tan

机构 * Purdue University(普渡大学) University of Michigan(密歇根大学) Meta Ann Arbor, Michigan, USA(美国密歇根州安阿伯) Menlo Park, California, USA(美国加州Menlo Park) West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10379 2026-06-26 cs.CL 版本更新 57%

Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness

并非所有证明都平等:超越正确性的LLM证明质量评估

Ivo Petrov, Jasper Dekoninck, Dimitar I. Dimitrov, Martin Vechev

机构 * INSAIT(INSAIT研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProofRank基准,评估证明的简洁性、计算便捷性、认知简单性、多样性及适应性,揭示正确性之外的证明质量差异及优劣权衡。

Comments 9 main text pages, 36 total pages, Accepted at ICML 2026 AI for Math workshop

详情

展开后加载摘要…

URL PDF HTML 收藏