arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 11 篇

2603.13443 2026-03-17 cs.SE cs.AI cs.PL 83%

NormCode Canvas: Making LLM Agentic Workflows Development Sustainable via Case-Based Reasoning

NormCode Canvas:通过基于案例的推理使LLM代理工作流开发可持续

Xin Guan, Yunshan Li, Ze Wang

机构 * Psylens AI, China(Psylens AI,中国) Shenzhen University, China(深圳大学,中国) University College London, United Kingdom(伦敦大学学院,英国)

专题命中 代码与定理证明 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 NormCode Canvas通过基于案例的推理实现多步骤LLM工作流的可持续开发,其核心是NormCode语言,确保每个执行检查点都是自包含的案例,从而消除隐含共享状态带来的问题。

Comments 16 pages, 5 figures. Submitted to ICCBR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13372 2026-03-17 cs.AI cs.LG 81%

The ARC of Progress towards AGI: A Living Survey of Abstraction and Reasoning

为AGI进步的ARC:抽象与推理的活体调查

Sahar Vahdati, Andrei Aioanei, Haridhra Suresh, Jens Lehmann

机构 * TIB - Leibniz Information Centre for Science and Technology(TIB - 科学技术信息研究中心) L3S Research Center, Leibniz University of Hannover(L3S研究所以汉诺威莱布尼茨大学) Dresden University of Technology, Amazon (work done outside of Amazon)(德累斯顿技术大学,亚马逊(非亚马逊工作))

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析三个版本的82种方法及ARC Prize竞赛,揭示了不同范式在版本间性能下降的规律,指出组合泛化能力的局限性,并强调测试时适应和精炼循环的重要性。

Comments Submitted to ACM Computing Surveys. Living survey website: https://nimi-ai.com/arc-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14703 2026-03-17 cs.SE cs.AI 79%

Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization

超越局部代码优化:软件系统优化的多智能体推理

Huiyun Peng, Parth Vinod Patil, Antonio Zhong Qiu, George K. Thiruvathukal, James C. Davis

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出多智能体框架,通过整合控制流、数据流与架构依赖信号,实现微服务系统的整体优化,提升吞吐量和响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14312 2026-03-17 cs.AI cond-mat.dis-nn cs.LG cs.MA q-bio.BM 62%

Autonomous Agents Coordinating Distributed Discovery Through Emergent Artifact Exchange

自主代理通过涌现式物品交换协调分布式发现

Fiona Y. Wang, Lee Marom, Subhadeep Pal, Rachel K. Luu, Wei Lu, Jaime A. Berkovich, Markus J. Buehler

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出ScienceClaw + Infinite框架,通过自主代理在无中央协调下进行科学探究,展示异构工具链、代理间涌现式收敛及可追溯推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14087 2026-03-17 cs.LG cs.CL 62%

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

理解下一token预测器中看似无用特征的出现

Mark Rofin, Jalal Naghiyev, Michael Hahn

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了训练中的Transformer模型如何计算看似冗余的抽象特征,并提出方法分析梯度信号对特定特征形成的影响,通过玩具任务和小型模型验证,揭示了预训练语言模型中形式推理领域特征的产生机制。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14007 2026-03-17 cs.AI 57%

Formal Abductive Explanations for Navigating Mental Health Help-Seeking and Diversity in Tech Workplaces

形式归纳解释用于导航心理健康求助与科技职场多样性

Belona Sonna, Alain Momo, Alban Grastien

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出形式归纳解释框架,用于系统揭示AI对科技职场心理健康求助预测的合理性。通过计算模型输出的严谨解释,支持选择适合不同心理科目的模型,并确保伦理稳健的救济计划。同时,明确考察性别等敏感属性对模型决策的影响,以支持公平性评估。

Comments Appeared in the Proceedings of the Empowering Women of Colour in AI-Driven Mental Health Research at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13603 2026-03-17 cs.DB cs.AI 57%

The Equivalence Theorem: First-Class Relationships for Structurally Complete Database Systems

等价定理:结构完备数据库系统的第一类关系

Matthew Alford

机构 * Network Service Group(网络服务组)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文证明了结构完备的知识表示需要四种互为依赖的能力,提出ATCH框架,并建立了SQL与TypeDB的表达性层级。

Comments 35 pages, 2 figures, Lean 4 formalization at https://github.com/Network-Services-Group/equivalence-theorem-lean4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 57%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02990 2026-03-17 cs.LG 57%

Learning to Repair Lean Proofs from Compiler Feedback

从编译器反馈中学习修复Lean证明

Evan Wang, Simon Chess, Daniel Lee, Siyuan Ge, Ajit Mallavarapu, Jarod Alper, Vasily Ilin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了将Lean证明修复作为监督学习问题,提出APRIL数据集,通过系统生成的证明错误与编译器诊断配对,提升修复准确性和反馈条件推理能力。

Comments 15 pages, 6 figures

Journal ref ICLR VerifAI Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06436 2026-03-17 cs.MA 50%

R3R: Decentralized Multi-Agent Collision Avoidance with Infinite-Horizon Safety

R3R:具有无限时间安全性的去中心化多智能体避障

Thomas Marshall Vielmetti, Devansh R. Agrawal, Dimitra Panagou

专题命中 代码与定理证明 :planning(abstract)

AI总结 R3R是首个在通信受限条件下提供无限时间安全保证的去中心化多智能体运动规划框架,通过结合安全框架与几何约束实现轨迹的可证明安全。

Comments 8 pages, LaTeX; submitted to the American Control Conference (ACC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 50%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏