arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2608.03327 2026-08-07 cs.AI 版本更新 57%

Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents

截图还是工具?在混合GUI-MCP计算机使用智能体中引出工具使用并管理多模态上下文

Siqi Fan, Minghao Li, Xiaoqian Ma, Wenhui Tan, Xiusheng Huang, Juntong Wu, Liujie Zhang, Shuo Shang, Weihang Chen

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对混合GUI-MCP计算机使用智能体,发现工具使用存在采用缺口,通过调整工具奖励与上下文压缩优化,提升了智能体性能并降低输入成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31134 2026-08-07 cs.AI 版本更新 57%

Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics

超越图书馆:用于自动形式化研究数学的智能体框架

Arshia Soltani Moakhar, Iman Gholami, Max Springer, Mahdi JafariRaviz, MohammadTaghi Hajiaghayi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出一种基于通用编码大语言模型的智能体自动形式化框架,通过多智能体管道和辅助引理技术,成功形式化了PutnamBench和STOC论文中的主要定理,其中两个证明无需额外公理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02774 2026-08-05 cs.CR cs.AI 新提交 57%

Privacy-Preserving AI Verification via Minimal Information Disclosure

通过最小信息披露实现隐私保护的AI验证

Sleem Abdelghafar, Gabriel Kulp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出最小信息披露(MID)方法,通过条件互信息衡量AI验证中的附带泄露,在多项验证任务中实现完美验证且零附带泄露,并支持基于Groth16 zk-SNARK的ZKP认证发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 57%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00981 2026-08-04 cs.AI 新提交 57%

Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

审计发现主张:面向智能体科学的双边准则,其负面侧可判定

Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出面向智能体科学的双边审计准则,通过实验揭示AI科学系统能力主张的夸大问题,证实智能体编写的程序在低计算量下可击败人类程序,但未明确可迁移的机制。

Comments 51 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09806 2026-08-04 cs.DL cond-mat.mtrl-sci cs.AI 版本更新 57%

An Autonomous Scientific Knowledge Generation Framework for AI-Driven Scientific Discovery

一种用于人工智能驱动科学发现的自主科学知识生成框架

Dibakar Datta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出自主科学知识生成框架,整合多种技术将科学出版物转化为适用于人工智能的知识库,以电光材料为例进行验证,实现从文献到知识库的转变,为人工智能驱动的科学发现提供了可扩展、领域独立的基础。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 57%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25018 2026-08-03 cs.LG 版本更新 57%

Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

共形级联:多层大语言模型推理的无分布精度保证

Yifan Dou, Shikan Lian, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究针对LLM级联推理成本高、置信分数校准不当等问题,提出共形级联框架,以共形预测集大小为推迟规则,提供无分布精度保证,在多基准测试中表现优于启发式级联,且无需模型训练,仅需黑盒API访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24033 2026-07-30 cs.LG cs.LO 版本更新 57%

Towards Verifiable Transformers: Solver-Checkable Circuit Explanations

迈向可验证的Transformer:求解器可检查的电路解释

Neel Somani

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 提出Verifiable Transformers框架,通过将任务局部Transformer电路转化为有界、求解器可检查的声明,实现电路属性的形式化验证。

Comments 23 pages. v2: adds GPT-2-scale verified distillation (three-edge verified quote circuit), LayerNorm removal for sparsemax models, and gated localization protocols

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08027 2026-07-30 cs.CL cs.CY 57%

"Amazing, They All Lean Left" -- Analyzing the Political Temperaments of Current LLMs

W. Russell Neuman, Chad Coleman, Ali Dasdan, Safinah Ali, Manan Shah, Kund Meghani

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25408 2026-07-29 cs.AI 新提交 57%

Context Assembly as the Controlled Variable: A Control-Theoretic View of Harness Policies for Frozen LLM Agents

作为受控变量的上下文组装:冻结大语言模型智能体利用策略的控制理论视角

Debjyoti Paul

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究聚焦大语言模型智能体,以往控制工具选择等,本文将上下文组装视为受控变量,通过上下文博弈或强化学习策略在线学习,进行形式分解、稳定性论证及不确定性校准分析,给出控制理论视角的相关证据。

Comments 6 pages, 2 figures, 1 table. Code and companion paper's data: https://github.com/dpaul0501/context-optimization-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14137 2026-07-29 cs.PL cs.AI cs.LO cs.SE 交叉投稿 57%

Untrusted Authors, Trusted Answers: A Calculus of Fidelity-Graded Translations

不可信作者,可信答案:保真度分级翻译演算

Christoph Kirsch

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究翻译问题,提出保真度分级翻译演算,该演算可按程序检查、通过粘贴组合,核心在Lean 4中机械化,在hurdy - gurdy平台实现,报告了多项实验结果,其增长模型通过任何人贡献语言对扩展语言支持。

Comments 29 pages. v2: rewritten on the two-plane principle; directional squares primary (exactness = the identity-embedding case, mechanized incl. the lax telescope); the answerability loop and its economy (demand books, recommended-then-registered); post-snapshot exhibits. Code, evidence, Lean mechanization: https://github.com/cksystemsgroup/hurdy-gurdy (tag arxiv.2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05775 2026-07-29 cs.CL cs.CY 版本更新 57%

Guardians and Offenders: A Survey on Harmful Content Generation and Safety Mitigation of LLM

守护者与违规者:大语言模型有害内容生成与安全缓解研究综述

Chi Zhang, Changjia Zhu, Junjie Xiong, Xiaoran Xu, Lingyao Li, Yao Liu, Zhuo Lu

机构 * University of South Florida(佛罗里达州立大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 综述大语言模型在内容创作中带来的风险与挑战,系统回顾相关研究,提出危害与防御统一分类法,分析越狱策略,评估缓解措施,指出评估局限,明确未来研究方向以推动语言技术稳健且符合伦理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01227 2026-07-28 cs.AI 版本更新 57%

The Lattice Representation Hypothesis of Large Language Models

大语言模型的晶格表示假说

Bo Xiong

机构 * Stanford University(斯坦福大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出大语言模型的晶格表示假说,通过嵌入几何将概念层次和逻辑运算统一到线性表示中,实验表明LLM嵌入编码概念晶格及其逻辑结构。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20525 2026-07-27 cs.AI math.CO math.NT 交叉投稿 57%

Autonomous disproofs of the sum-product conjecture over $\mathbb R$ with GPT-5.5 Pro

使用GPT-5.5 Pro对实数上的和积猜想进行自主反证

Yichen Huang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文借助GPT-5.5 Pro构建智能体,通过三阶段提示管道,对实数上的和积猜想进行自主反证,8次试验中7次成功生成正确证明,每次试验平均用132.4k推理令牌,还发布相关内容供重现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21162 2026-07-24 cs.LG cs.CR 新提交 57%

Agree on the Model, Verify the Inference: GKR Protocols for HND-Based Transformer Inference

就模型达成一致,验证推理:基于同态-非同态分解变压器的HND的GKR协议

Xiaolong Liang, Juanjuan Li, Rui Qin, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 研究外包变压器推理问题,提出GKR-HND协议验证同态-非同态分解变压器多项式主干,保留验证器检查记录与开口,委托公共评估给计算工作者,实验验证了证明路径与委托计算,无需密集矩阵重放。

Comments 24 pages, including 4 pages of supporting information; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16269 2026-07-21 eess.SP cs.AI 新提交 57%

From Intent to Infrastructure: LLM-Driven Agent Compilers for ISAC Networks

从意图到基础设施:用于ISAC网络的基于大语言模型的智能体编译器

Lijie Zheng, Xudong Zhong, Baoquan Ren, Xiangwu Gong, Xinghui Zhu, Ji He

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Institute of Systems General, Academy of Systems Engineering, Academy of Military Sciences(系统工程院系统一般研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究ISAC网络从概念验证到系统级部署的设计难题,提出基于大语言模型的智能体编译器,经四个阶段工作产生ISAC策略图,运行时引擎支持闭环自适应,以无人机救援为例展示编译过程并讨论开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17823 2026-07-21 cs.LG 新提交 57%

Theoretical Foundations of $\max$@$k$ Reinforcement Learning

$\max$@$k$强化学习的理论基础

Riccardo Poiani, Martino Bernasconi, Andrea Celli

机构 * Bocconi University(博科尼大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 57%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13716 2026-07-16 cs.AI 新提交 57%

CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems

CAVA:用于智能代理人工智能系统运行时治理的规范动作验证与认证

Zexun Wang

机构 * Ond Holdings Inc(Ond控股公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 研究智能代理人工智能系统异构运行时带来的治理问题。提出CAVA,将异构代理活动转换为规范动作对象。通过基准参考实现研究,为部署者端人工智能治理提供动作级规范化和语义模式的系统表述。

Comments 35 pages. Working paper on canonical action verification, runtime governance, semantic pattern detection, and approval-bound action receipts

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19593 2026-07-16 cs.AI cs.MA 版本更新 57%

A Survey on Hypergame Theory: Modelling Misaligned Perceptions and Nested Beliefs for Multi-Agent Systems

关于超博弈理论的综述:为多智能体系统建模错位感知与嵌套信念

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了超博弈理论在多智能体系统中的应用,分析了其建模错位感知与嵌套信念的能力及现有研究中的趋势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09632 2026-07-13 quant-ph cs.AI 新提交 57%

Lean-QIT: Towards a Formal Infrastructure for Quantum Information Theory

Lean-QIT:迈向量子信息理论的形式化基础设施

Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang

机构 * QudeLeap Research(QudeLeap研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Quantum Science Center of Guangdong-Hong Kong-Macao Greater Bay Area(粤港澳大湾区量子科学中心) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在为量子信息理论构建形式化基础设施,通过Lean 4库LeanQIT提供相关接口,将多个重要定理形式化,分离操作定义与解析表征,为形式化QIT及相关推理提供基础和知识底物。

Comments 24+5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 57%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08891 2026-07-12 cs.ET cs.AI cs.HC 57%

Designing and Evaluating an AI-enhanced Immersive Multidisciplinary Simulation (AIMS) for Interprofessional Education

设计和评估一种增强人工智能的沉浸式跨学科模拟(AIMS)用于多专业教育

Ruijie Wang, Jie Lu, Bo Pei, Evonne Jones, Jamey Brinson, Timothy Brown

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 AIMS通过整合AI和虚拟环境,为多专业教育提供沉浸式模拟,提升学生协作能力和临床推理能力。

Comments 15 pages. Immersive Learning Research-Academic (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05397 2026-07-08 cs.CR cs.AI 新提交 57%

Proof of Execution: Runtime Verification for Governed AI Agent Actions

执行证明:受治理人工智能代理行动的运行时验证

James Rhodes, George Kang

机构 * AlphaBitCore, Inc.(AlphaBitCore公司)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究人工智能代理行动正确性验证问题,提出运行时证明(PoE)方法构建执行三元组及相关谓词和保证,证明其合理性,通过原型测试验证效果,能将多方面绑定到可检查对象,使受治理执行可证。

Comments 14 pages, 1 figure, 4 tables, 1 algorithm; includes formal soundness and replay theorems with witness constructions in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13566 2026-07-08 cs.AI 新提交 57%

A Three-Layer Framework for AI in Scientific Discovery

人工智能在科学发现中的三层框架

Guojun Liao

机构 * Department of Mathematics, University of Texas at Arlington(德克萨斯大学阿灵顿分校数学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出AI在科学发现中的三层框架,核心创新是第二层:通过定性推理进行模型形成,识别框架结构不足并寻找缺失概念,通过三个案例说明其重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05188 2026-07-07 cs.LG cs.SE 新提交 57%

Latent Programming Horizons in Coding Agents

编码智能体中的潜在编程视界

André Silva, Han Tu, Martin Monperrus

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 该研究探究编码智能体底层语言模型的程序内部表征,通过逻辑回归探针发现其残差流可线性编码程序属性,还能提前约25步预测后续编辑结果,为编码智能体的机制可解释性研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏