arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 9 篇

2605.23972 2026-05-26 cs.AI cs.CL cs.RO 73%

Why We Need World Models for AGI: Where LLMs Fail and How World Models May Outperform

为什么我们需要世界模型来实现通用人工智能:大语言模型失败之处以及世界模型如何可能超越

Feisal Alaswad, Batoul Aljaddouh, Maher Alrahhal, Poovammal E, Talal Bonny

机构 * Department of Computing Technologies(计算技术系) SRM Institute of Science and Technology(SRM科学与技术学院) Bio-Sensing and Bio-Sensors Group(生物传感与生物传感器组) Smart Automation and Communication Technologies Research Institute of Sciences and Engineering(科学与工程智能自动化与通信技术研究所) University of Sharjah, UAE(阿联酋沙迦大学) Department of Computer Engineering(计算机工程系) College of Computing and Informatics(计算与信息学院)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提出潜在动态推理(LDI)概念和Flux环境案例研究,论证了大语言模型在因果推理、状态跟踪和长程规划上的局限性,并展示基于显式状态空间的强化学习智能体在长程游戏中显著优于纯文本LLM。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25181 2026-05-26 cs.AI 70%

SpecAlign: A Semantic Alignment Framework for SystemVerilog Assertion Generation

SpecAlign: 一种用于 SystemVerilog 断言生成的语义对齐框架

Jaime Rafael Imperial, Hao Zheng

机构 * University of South Florida(佛罗里达州立大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出 SpecAlign 框架,通过基于蕴含的分类和自一致性投票机制,评估并改进 LLM 生成的 SVA 与自然语言规范之间的语义对齐,无需黄金 RTL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23931 2026-05-26 cs.AI cs.PL cs.SE 70%

BODHI: Precise OS Kernel Specification Inference

BODHI:精确的操作系统内核规范推断

Zhiming Chang, Ziyang Li

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Johns Hopkins University(约翰霍普金斯大学) Department of Computer Science(计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出一种领域知识提示方法BODHI,通过结构化C到Python翻译指南增强少样本提示,在OSV-Bench基准上将Pass@1从55.10%提升至96.73%,缩小了通用代码生成与形式规范合成之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24597 2026-05-26 cs.AI cs.CL cs.LG 67%

Learning to Reason Efficiently with A* Post-Training

学习通过A*后训练进行高效推理

Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov, Mrinmaya Sachan, Bernhard Schölkopf, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所) Purdue University(普渡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过A*搜索算法指导LLM生成正确且高效的推理步骤,提出监督微调和强化学习两种训练方法,在1B-3B参数模型上显著提升推理准确性和效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24462 2026-05-26 cs.CE 67%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09943 2026-05-26 cs.AI 57%

PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMs

PathMem: 面向病理学多模态大模型的认知对齐记忆转换

Jinyue Li, Yuci Liang, Qiankun Li, Xinheng Lyu, Jiayu Qian, Huabao Chen, Kun Wang, Zhigang Zeng, Anil Anthony Bharath, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13389 2026-05-26 cs.AI 57%

From Next Token Prediction to (STRIPS) World Models

从下一个词预测到(STRIPS)世界模型

Carlos Núñez-Molina, Vicenç Gómez, Hector Geffner

机构 * RWTH Aachen University, Germany(亚琛工业大学,德国) Universitat Pompeu Fabra, Spain(庞培法华大学,西班牙)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 研究下一个词预测能否产生支持规划的世界模型,提出STRIPS Transformer和标准Transformer两种架构,在五个经典规划领域评估训练准确率、泛化能力和规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25411 2026-05-26 cs.CR cs.SC 50%

Heimdall: Formally Verified Automated Migration of Legacy eBPF Programs to Rust

Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移

Vishnu Asutosh Dasu, Monika Santra, Md Rafi Ur Rashid, Ashish Kumar, Saeid Tizpaz-Niari, Gang Tan

专题命中 代码与定理证明 :verifier(abstract)

AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24332 2026-05-26 cs.HC 50%

Tacit Signal Infrastructure: Towards AI Systems that Model Expert Sensing Over Time

隐性信号基础设施:迈向随时间建模专家感知的AI系统

Annie Yuan

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出隐性信号基础设施,通过长期认知操作和认知运营管理器,使AI系统能够建模专家随时间变化的隐性感知,从而超越显性知识处理。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏