arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 5 篇

2603.21340 2026-03-24 cs.AI cs.DC 70%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22136 2026-03-24 cs.CL cs.DB 57%

The Semantic Ladder: A Framework for Progressive Formalization of Natural Language Content for Knowledge Graphs and AI Systems

语义阶梯:一种用于知识图谱和人工智能系统自然语言内容逐步形式化的框架

Lars Vogt

机构 * Leibniz Institute for the Analysis of Biodiversity Change (LIB)(莱布尼茨生物多样性变化分析研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语义阶梯框架,通过逐步形式化自然语言内容,解决自然语言与形式化模型之间的表示差异问题,支持知识图谱和AI系统的可扩展性和互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21315 2026-03-24 cs.LG 57%

FluidWorld: Reaction-Diffusion Dynamics as a Predictive Substrate for World Models

FluidWorld: 反应-扩散动力学作为世界模型的预测性基质

Fabien Polly

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出FluidWorld,通过反应-扩散型偏微分方程实现世界模型预测,对比Transformer和ConvLSTM基线,展示PDE在参数效率和空间结构保留上的优势。

Comments 18 pages, 16 figures, 4 tables. Code available at https://github.com/infinition/FluidWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20449 2026-03-24 cs.SE cs.AI 57%

Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents

辅助验证工具增强大语言模型代理的政策合规性

Cailin Winston, Claris Winston, René Just

机构 * University of Washington(华盛顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于SMT求解器的框架,用于确保工具增强大语言模型代理在工具使用上的政策合规性,通过将自然语言政策转化为形式逻辑约束,并在运行时检查工具调用以防止违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20264 2026-03-24 cs.PL cs.LO 50%

Can LLMs Perform Synthesis?

LLMs能否进行合成?

Derek Egolf, Yuhao Zhou, Stavros Tripakis

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文比较了LLMs与符号工具在程序合成任务中的表现,发现符号工具在多个领域均优于Qwen和GPT-5,且执行时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏