arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 8 篇

2608.09277 2026-08-11 cs.AI cs.PL 新提交 79%

P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation

P³:用于验证代码生成的程序与证明联合规划

Zenan Li, Ziran Yang, Peiyang Song, Zhaoyu Li, Kaiyu Yang

机构 * Apodex Princeton University(普林斯顿大学) Caltech(加州理工学院) University of Toronto(多伦多大学)

专题命中 代码与定理证明 :planning(title,abstract);分类 cs.AI

AI总结 P³是一种用于验证代码生成的程序与证明联合规划的LLM智能体工作流,在三个基准上的求解率优于基线,还降低了API成本与运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07593 2026-08-11 cs.HC cs.AI cs.IR 新提交 79%

Weather- and Location-Aware Agentic Dining Recommendation: Leveraging LLM World Knowledge for Region-Sensitive Contextual Reasoning

感知天气与位置的智能体餐饮推荐:利用大语言模型世界知识开展区域敏感语境推理

Kadharmoideen Fadurudeen

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出感知天气与位置的智能体餐饮推荐系统,利用LLM的世界知识生成区域敏感的适配天气的餐饮推荐,为智能体推荐提供了可扩展的架构模式。

Comments 5 pages. An agentic LLM system that reasons over combined location and weather context for region-sensitive dining recommendation. Working prototype implemented and briefly deployed end-to-end

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21678 2026-08-11 cs.LG cs.AI cs.CL 版本更新 75%

Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers

可解码但不忠实:将自然语言理由与程序化验证器耦合

Vatsal Ananthula, Adarsh Kumarappan

机构 * AI4Math

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出验证器耦合推理框架,通过一致性训练使验证器信息可从理由表示中解码,但发现可解码性不保证忠实生成,在多个任务中验证了该差距。

Comments Accepted to the ICML 2026 AI4Math Workshop as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07476 2026-08-11 cs.AI cs.LO 新提交 57%

Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility

结构理论中的确定化:基于闭包、可比性与联合可容许性的统一框架

Hai Hai Fu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出了基于闭包、可比性与联合可容许性的统一框架,用于从多结构理论构造典范解释,区分非确定性类型并给出对应确定化机制,还可应用于LLM辅助推理以分析幻觉问题。

Comments Formal framework paper on canonicalization and determinization in structure theories; version v2.16.4; 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04273 2026-08-11 cs.AI 版本更新 57%

Human agency in initial human-AI proof formalization workflows

表征初始人机交互的证明形式化工作流

Katherine M. Collins, Simon Frieder, Jonas Bayer, Jacob Loader, Jeck Lim, Peiyang Song, Fabian Zaiser, Lexin Zhou, Shanda Li, Sam Looi, Joshua B. Tenenbaum, Umang Bhatt, Adrian Weller, Jose Hernandez-Orallo, Cameron E. Freer, Valerie Chen, Ilia Sucholutsky

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学) Caltech(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Universitat Politècnica de València(瓦伦西亚理工大学) New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 通过混合方法分析,研究人们在形式化证明过程中对AI工具的需求、障碍及实际使用模式,发现AI辅助能提高形式化准确率且用户偏好多样但普遍希望保持人类对证明发现过程的高层控制。

Comments Updated working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19329 2026-08-11 cs.SE cs.AI 版本更新 57%

Goedel-Code-Prover: Hierarchical Proof Search for Open State-of-the-Art Code Verification

Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索

Zenan Li, Ziran Yang, Deyuan He, Haoyu Zhao, Andrew Zhao, Shange Tang, Kaiyu Yang, Aarti Gupta, Zhendong Su, Chi Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Princeton Language and Intelligence(普林斯顿语言与智能实验室) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) MiroMind

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。

Comments Published as a COLM paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09312 2026-08-11 cs.NI 新提交 50%

Automated Synthesis of Deterministic Cross-Domain Interfaces

确定性跨域接口的自动合成

Konstantinos Christodoulopoulos, Antonis Selentis-Boulntadakis

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究提出框架,利用LLM实现智能体与处理程序模块,自动合成跨域确定性网络的静态、动态契约,经实验验证其动态契约性能优于静态配置,且分工模式可保障模型可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17798 2026-08-11 cs.SE cs.CR 版本更新 50%

CognixShield: PoV-Guided Vulnerable API Usage Detection in Large Codebases via LLMs

CognixShield:基于LLM的、面向大型代码库的PoV引导式漏洞API使用检测

Quanzhi Fu, Wang Lingxiang, Wenjia Song, Gelei Deng, Yi Liu, Dan Williams, Ying Zhang

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 CognixShield是一款LLM驱动的框架,通过保留语义的AST碎片化、感知漏洞的多智能体RAG、PoV引导的语义推理三个核心组件,在57个Java应用上实现了优于现有工具的漏洞API使用检测性能。

Comments accepted in ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏