arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 128 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 128 篇

2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 57%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21162 2026-07-24 cs.LG cs.CR 新提交 57%

Agree on the Model, Verify the Inference: GKR Protocols for HND-Based Transformer Inference

就模型达成一致,验证推理:基于同态-非同态分解变压器的HND的GKR协议

Xiaolong Liang, Juanjuan Li, Rui Qin, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 研究外包变压器推理问题,提出GKR-HND协议验证同态-非同态分解变压器多项式主干,保留验证器检查记录与开口,委托公共评估给计算工作者,实验验证了证明路径与委托计算,无需密集矩阵重放。

Comments 24 pages, including 4 pages of supporting information; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 57%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17823 2026-07-21 cs.LG 新提交 57%

Theoretical Foundations of $\max$@$k$ Reinforcement Learning

$\max$@$k$强化学习的理论基础

Riccardo Poiani, Martino Bernasconi, Andrea Celli

机构 * Bocconi University(博科尼大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 57%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13716 2026-07-16 cs.AI 新提交 57%

CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems

CAVA:用于智能代理人工智能系统运行时治理的规范动作验证与认证

Zexun Wang

机构 * Ond Holdings Inc(Ond控股公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究智能代理人工智能系统异构运行时带来的治理问题。提出CAVA,将异构代理活动转换为规范动作对象。通过基准参考实现研究,为部署者端人工智能治理提供动作级规范化和语义模式的系统表述。

Comments 35 pages. Working paper on canonical action verification, runtime governance, semantic pattern detection, and approval-bound action receipts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交 57%

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05397 2026-07-08 cs.CR cs.AI 新提交 57%

Proof of Execution: Runtime Verification for Governed AI Agent Actions

执行证明:受治理人工智能代理行动的运行时验证

James Rhodes, George Kang

机构 * AlphaBitCore, Inc.(AlphaBitCore公司)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究人工智能代理行动正确性验证问题,提出运行时证明(PoE)方法构建执行三元组及相关谓词和保证,证明其合理性,通过原型测试验证效果,能将多方面绑定到可检查对象,使受治理执行可证。

Comments 14 pages, 1 figure, 4 tables, 1 algorithm; includes formal soundness and replay theorems with witness constructions in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13566 2026-07-08 cs.AI 新提交 57%

A Three-Layer Framework for AI in Scientific Discovery

人工智能在科学发现中的三层框架

Guojun Liao

机构 * Department of Mathematics, University of Texas at Arlington(德克萨斯大学阿灵顿分校数学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出AI在科学发现中的三层框架,核心创新是第二层:通过定性推理进行模型形成,识别框架结构不足并寻找缺失概念,通过三个案例说明其重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 57%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05032 2026-07-07 cs.CL 新提交 57%

Multi-Large Language Model Orchestrated Severity Assessment of Clinical Records (MOSAIC)

临床记录的多大型语言模型编排严重程度评估(MOSAIC)

Manuela Del Castillo Suero, Arnault-Quentin Vermillet, Nicole Sonne Heckmann, Darmendra Ramcharran, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克) School of Pharmacy, University of Rhode Island(罗德岛大学药学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究用MOSAIC这一两阶段智能语言模型框架对2型糖尿病严重程度进行表型分析,以合成队列评估其与多种算法真值对比情况及全因死亡率等,结果显示该框架有优势,智能分类与固定规则执行不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04232 2026-07-07 cs.SE cs.CL 新提交 57%

Teaching Code LLMs to Reason with Intermediate Formal Specifications

使用中间形式规范训练代码语言模型进行推理

Minh Le-Anh, Cuong Chi Le, Tien N. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hanoi Univ. of Science and Tech.(河内科学技术大学) Texas, USA(得克萨斯州,美国) Hanoi, Vietnam(河内,越南)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 研究可执行检查点规范生成,介绍SpecCoder框架从多种程序学习,能选正确规范拒错误执行。引入HumanExec基准测试,实验表明其提升了检查点规范质量及下游正确性推理和修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03701 2026-07-07 cs.AR cs.CR cs.LG 新提交 57%

SABLE: An NDA-Safe Closed-Loop LLM Framework for Analog Circuit Optimization in Industrial EDA Flows

SABLE:工业 EDA 流程中用于模拟电路优化的 NDA 安全闭环 LLM 框架

Xunqi Li, Chris H. Kim

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究针对工业模拟流程中数据安全问题,提出 SABLE 框架,结合多种安全措施,能让 LLM 通过特定工具优化模拟电路,在实际任务中评估多个模型,验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01247 2026-07-03 cs.CY cs.AI 新提交 57%

LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability

LLMs作为数学考试评分的助教:可靠性与实际可用性

Aastha Sapkota, M. G. Sarwar Murshed

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 评估六种LLM配置在离散数学考试评分中的表现,发现宽松评分策略降低错误率,但点校准与排名保持仍是不同目标。

Comments 12 Pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00972 2026-07-02 cs.AI 新提交 57%

Bayesian Uncertainty Propagation for Agentic RAG Pipelines: A Proof-of-Concept Study on Multi-Hop Question Answering

面向智能体RAG管道的贝叶斯不确定性传播:多跳问答的概念验证研究

Louis Donaldson, Connor Walker, Koorosh Aslansefat, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种不确定性感知的智能体RAG框架,通过贝叶斯网络传播各阶段的不确定性信号,以估计系统级不确定性并定位潜在故障点,在HotpotQA上表现有效,但在StrategyQA上受限于校准问题。

Comments Submitted for 7th International Conference on Maintenance and Intelligent Asset Management (ICMIAM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32007 2026-07-01 cs.AI 新提交 57%

AxDafny: Agentic Verified Code Generation in Dafny

AxDafny: Dafny中的智能验证代码生成

Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27736 2026-06-29 cs.AI cs.CR 新提交 57%

ToE: A Hierarchical and Explainable Claim Verification Framework with Dynamic Multi-source Evidence Retrieval and Aggregation

ToE:一种具有动态多源证据检索与聚合的分层可解释声明验证框架

Zhaoqi Wang, Zijian Zhang, Kun Zheng, Zhen Li, Xin Li, Chunlei Li, Jiamou Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息科学与技术学院) TravelSky Technology Limited(TravelSky技术有限公司) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出Tree of Evidence (ToE)框架,通过强化学习驱动的多源检索、证据评估和参数树聚合,实现可解释的自动事实核查,在多个数据集上提升4-24个百分点,尤其对抗性毒化输入效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26857 2026-06-26 cs.AI 新提交 57%

LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation

LCAi: 基于大数据融合与检索增强生成辅助解释的生命周期评估

Georgios Tsironis, Juan D. Medrano-Garcia, Gonzalo Guillen-Gosalbez

机构 * Institute for Chemical and Bioengineering, Department of Chemistry and Applied Biosciences, ETH Zürich(苏黎世联邦理工学院化学与应用生物科学系化学与生物工程研究所) NCCR Catalysis(瑞士国家研究能力中心催化研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种视角条件检索增强生成框架,通过多视角检索与受控合成,在AI辅助生命周期评估中实现结构化解释,减少幻觉风险并保持跨领域多样性。

Comments 23 pages, 14 figures, 6 tables. Includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26490 2026-06-26 cs.SE cs.AI cs.LO cs.PL 新提交 57%

An Empirical Study of LLM-Generated Specifications for VeriFast

LLM 生成的 VeriFast 规范实证研究

Wen Fan, Minh Tran, Sanya Dod, Xin Hu, Marilyn Rego, Danning Xie, Jenna DiVincenzo, Lin Tan

机构 * Purdue University(普渡大学) University of Michigan(密歇根大学) Meta Ann Arbor, Michigan, USA(美国密歇根州安阿伯) Menlo Park, California, USA(美国加州Menlo Park) West Lafayette, Indiana, USA(美国印第安纳州西拉法叶)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型为分离逻辑验证器 VeriFast 生成规范的能力,发现虽然功能保持良好(>91%),但验证成功率仅31.4%,主要错误源于领域知识不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 57%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25363 2026-06-25 cs.IR cs.AI math.HO 新提交 57%

TheoremGraph: Bridging Formal and Informal Mathematics

TheoremGraph:连接形式化与非形式化数学

Simon Kurgan, Evan Wang, Eric Leonen, Sophie Szeto, Luke Alexander, Artemii Remizov, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。

Comments 31 pages, 9 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24414 2026-06-24 cs.AI 新提交 57%

Cycle-Consistent Neural Explanation of Formal Verification Certificates

形式验证证书的循环一致性神经解释

Andoni Rodriguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。

Comments 15 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23913 2026-06-24 cs.LG 新提交 57%

Closing the Loop: Formally Verified Law as a Reward Signal for Self-Improving Legal AI

闭环:形式化验证的法律作为自我改进法律AI的奖励信号

Armin Heydari, Torben Leowald

机构 * Harvard University(哈佛大学) Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 提出一种架构,通过LLM驱动的形式化转换和验证内核,为法律AI提供可验证的奖励信号,实现闭环强化学习,并在多个法律领域展示其优势。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23768 2026-06-24 cs.CR cs.AI cs.LO 新提交 57%

Cryptographic certificates of validity for trustworthy AI

可信AI的密码学有效性证书

Murdoch J. Gabbay

机构 * Heriot-Watt University(赫瑞思-瓦特大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 57%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23277 2026-06-23 cs.AI 新提交 57%

GIF: Locally Sound Geometric Information Flow Control for LLMs

GIF: 局部几何信息流控制用于大语言模型

Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出GIF框架,利用LLM雅可比矩阵和局部输出几何上界香农互信息,实现可扩展的信息流追踪,在提示注入和隐私泄露任务中达到近完美召回,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22495 2026-06-23 cs.AI 新提交 57%

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Grounded Scaling: 为什么代理型AI需要确定性环境

Liang Ding, Xintong Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19121 2026-06-23 cs.SE cs.CL cs.HC 新提交 57%

Written by AI, Managed by AI: Semantic Space Control and Index Sickness Elimination Across 391 Consecutive Sessions

由AI编写,由AI管理:跨越391个连续会话的语义空间控制与索引病消除

Hui Zhang, Shuren Song

机构 * Shenzhen Yunxi Technology Co., Ltd.(深圳云曦科技有限公司) Information Technology Center, Tsinghua University(清华大学信息科学技术中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文通过真实软件项目中的行动研究,发现长期LLM协作中增加形式约束反而导致“索引病”,提出“基线-日志物理分离”机制,有效消除该问题。

Comments 22 pages, 2 tables, 1 figure. Action research. Bilingual submission (Chinese companion version included as supplementary). Submitted to ICSE 2027 IOR track

详情

展开后加载摘要…

URL PDF HTML 收藏