arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3932 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 128 篇

2608.07167 2026-08-10 cs.AI 新提交 57%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02774 2026-08-05 cs.CR cs.AI 新提交 57%

Privacy-Preserving AI Verification via Minimal Information Disclosure

通过最小信息披露实现隐私保护的AI验证

Sleem Abdelghafar, Gabriel Kulp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出最小信息披露(MID)方法,通过条件互信息衡量AI验证中的附带泄露,在多项验证任务中实现完美验证且零附带泄露,并支持基于Groth16 zk-SNARK的ZKP认证发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 57%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00981 2026-08-04 cs.AI 新提交 57%

Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

审计发现主张:面向智能体科学的双边准则,其负面侧可判定

Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出面向智能体科学的双边审计准则,通过实验揭示AI科学系统能力主张的夸大问题,证实智能体编写的程序在低计算量下可击败人类程序,但未明确可迁移的机制。

Comments 51 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 57%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 57%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21162 2026-07-24 cs.LG cs.CR 新提交 57%

Agree on the Model, Verify the Inference: GKR Protocols for HND-Based Transformer Inference

就模型达成一致,验证推理:基于同态-非同态分解变压器的HND的GKR协议

Xiaolong Liang, Juanjuan Li, Rui Qin, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 研究外包变压器推理问题,提出GKR-HND协议验证同态-非同态分解变压器多项式主干,保留验证器检查记录与开口,委托公共评估给计算工作者,实验验证了证明路径与委托计算,无需密集矩阵重放。

Comments 24 pages, including 4 pages of supporting information; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 57%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17823 2026-07-21 cs.LG 新提交 57%

Theoretical Foundations of $\max$@$k$ Reinforcement Learning

$\max$@$k$强化学习的理论基础

Riccardo Poiani, Martino Bernasconi, Andrea Celli

机构 * Bocconi University(博科尼大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 57%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13716 2026-07-16 cs.AI 新提交 57%

CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems

CAVA:用于智能代理人工智能系统运行时治理的规范动作验证与认证

Zexun Wang

机构 * Ond Holdings Inc(Ond控股公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究智能代理人工智能系统异构运行时带来的治理问题。提出CAVA,将异构代理活动转换为规范动作对象。通过基准参考实现研究,为部署者端人工智能治理提供动作级规范化和语义模式的系统表述。

Comments 35 pages. Working paper on canonical action verification, runtime governance, semantic pattern detection, and approval-bound action receipts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交 57%

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05397 2026-07-08 cs.CR cs.AI 新提交 57%

Proof of Execution: Runtime Verification for Governed AI Agent Actions

执行证明:受治理人工智能代理行动的运行时验证

James Rhodes, George Kang

机构 * AlphaBitCore, Inc.(AlphaBitCore公司)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究人工智能代理行动正确性验证问题,提出运行时证明(PoE)方法构建执行三元组及相关谓词和保证,证明其合理性,通过原型测试验证效果,能将多方面绑定到可检查对象,使受治理执行可证。

Comments 14 pages, 1 figure, 4 tables, 1 algorithm; includes formal soundness and replay theorems with witness constructions in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13566 2026-07-08 cs.AI 新提交 57%

A Three-Layer Framework for AI in Scientific Discovery

人工智能在科学发现中的三层框架

Guojun Liao

机构 * Department of Mathematics, University of Texas at Arlington(德克萨斯大学阿灵顿分校数学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出AI在科学发现中的三层框架,核心创新是第二层:通过定性推理进行模型形成,识别框架结构不足并寻找缺失概念,通过三个案例说明其重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 57%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05032 2026-07-07 cs.CL 新提交 57%

Multi-Large Language Model Orchestrated Severity Assessment of Clinical Records (MOSAIC)

临床记录的多大型语言模型编排严重程度评估(MOSAIC)

Manuela Del Castillo Suero, Arnault-Quentin Vermillet, Nicole Sonne Heckmann, Darmendra Ramcharran, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克) School of Pharmacy, University of Rhode Island(罗德岛大学药学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究用MOSAIC这一两阶段智能语言模型框架对2型糖尿病严重程度进行表型分析,以合成队列评估其与多种算法真值对比情况及全因死亡率等,结果显示该框架有优势,智能分类与固定规则执行不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04232 2026-07-07 cs.SE cs.CL 新提交 57%

Teaching Code LLMs to Reason with Intermediate Formal Specifications

使用中间形式规范训练代码语言模型进行推理

Minh Le-Anh, Cuong Chi Le, Tien N. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hanoi Univ. of Science and Tech.(河内科学技术大学) Texas, USA(得克萨斯州,美国) Hanoi, Vietnam(河内,越南)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究可执行检查点规范生成,介绍SpecCoder框架从多种程序学习,能选正确规范拒错误执行。引入HumanExec基准测试,实验表明其提升了检查点规范质量及下游正确性推理和修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03701 2026-07-07 cs.AR cs.CR cs.LG 新提交 57%

SABLE: An NDA-Safe Closed-Loop LLM Framework for Analog Circuit Optimization in Industrial EDA Flows

SABLE:工业 EDA 流程中用于模拟电路优化的 NDA 安全闭环 LLM 框架

Xunqi Li, Chris H. Kim

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究针对工业模拟流程中数据安全问题,提出 SABLE 框架,结合多种安全措施,能让 LLM 通过特定工具优化模拟电路,在实际任务中评估多个模型,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01247 2026-07-03 cs.CY cs.AI 新提交 57%

LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

LLMs作为数学考试评分的助教:可靠性与实际可用性

Aastha Sapkota, M. G. Sarwar Murshed

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 评估六种LLM配置在离散数学考试评分中的表现,发现宽松评分策略降低错误率,但点校准与排名保持仍是不同目标。

Comments 12 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00972 2026-07-02 cs.AI 新提交 57%

Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering

面向智能体RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究

Louis Donaldson, Connor Walker, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种不确定性感知的智能体RAG框架,通过贝叶斯网络传播各阶段的不确定性信号,以估计系统级不确定性并定位潜在故障点,在HotpotQA上表现有效,但在StrategyQA上受限于校准问题。

Comments Submitted for 7th International Conference on Maintenance and Intelligent Asset Management (ICMIAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32007 2026-07-01 cs.AI 新提交 57%

AxDafny: Agentic Verified Code Generation in Dafny

AxDafny: Dafny中的智能验证代码生成

Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27736 2026-06-29 cs.AI cs.CR 新提交 57%

ToE: A Hierarchical and Explainable Claim Verification Framework with Dynamic Multi-source Evidence Retrieval and Aggregation

ToE:一种具有动态多源证据检索与聚合的分层可解释声明验证框架

Zhaoqi Wang, Zijian Zhang, Kun Zheng, Zhen Li, Xin Li, Chunlei Li, Jiamou Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息科学与技术学院) TravelSky Technology Limited(TravelSky技术有限公司) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Tree of Evidence (ToE)框架,通过强化学习驱动的多源检索、证据评估和参数树聚合,实现可解释的自动事实核查,在多个数据集上提升4-24个百分点,尤其对抗性毒化输入效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26857 2026-06-26 cs.AI 新提交 57%

LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation

LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估

Georgios Tsironis, Juan D. Medrano-Garcia, Gonzalo Guillen-Gosalbez

机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) NCCR Catalysis(瑞士国家研究能力中心催化研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。

Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26490 2026-06-26 cs.SE cs.AI cs.LO cs.PL 新提交 57%

An Empirical Study of LLM-Generated Specifications for VeriFast

LLM 生成的 VeriFast 规范实证研究

Wen Fan, Minh Tran, Sanya Dod, Xin Hu, Marilyn Rego, Danning Xie, Jenna DiVincenzo, Lin Tan

机构 * Purdue University(普渡大学) University of Michigan(密歇根大学) Meta Ann Arbor, Michigan, USA(美国密歇根州安阿伯) Menlo Park, California, USA(美国加州Menlo Park) West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 57%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25363 2026-06-25 cs.IR cs.AI math.HO 新提交 57%

TheoremGraph: Bridging Formal and Informal Mathematics

TheoremGraph:连接形式化与非形式化数学

Simon Kurgan, Evan Wang, Eric Leonen, Sophie Szeto, Luke Alexander, Artemii Remizov, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。

Comments 31 pages, 9 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24414 2026-06-24 cs.AI 新提交 57%

Cycle-Consistent Neural Explanation of Formal Verification Certificates

形式验证证书的循环一致性神经解释

Andoni Rodriguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。

Comments 15 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏