arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 6 篇

2509.25239 2026-05-13 cs.AI cs.CL cs.LG 80%

A Formal Comparison Between Chain of Thought and Latent Thought

链式思维与潜在思维的正式比较

Kevin Xu, Issei Sato

机构 * Department of Computer Science, The University of Tokyo, Japan(东京大学计算机科学系)

专题命中 代码与定理证明 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文对比了链式思维与潜在思维,发现潜在思维在并行计算上更高效,而链式思维能通过随机解码实现近似计数与采样。

Comments Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL 79%

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10974 2026-05-13 cs.LG cs.AI 62%

Vertex-Softmax: Tight Transformer Verification via Exact Softmax Optimization

顶点softmax:通过精确softmax优化实现严格的transformer验证

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出顶点softmax方法,通过精确优化softmax函数,实现transformer注意力的严格验证,提升了认证率并收紧了下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12239 2026-05-13 cs.PL cs.AI math.CT 57%

Harness Engineering as Categorical Architecture

利用工程作为范畴架构

Bogdan Banu

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文提出利用范畴架构三元组(G, Know, Phi)作为LLM代理的正式化框架,通过映射四个支柱到三元组组件,提供结构保证并验证了编译器在不同框架中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12139 2026-05-13 cs.AI 57%

BoolXLLM: LLM-Assisted Explainability for Boolean Models

BoolXLLM: 基于大语言模型的布尔模型可解释性

Du Cheng, Serdar Kadioglu, Xin Wang

机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出BoolXLLM框架,结合大语言模型提升布尔模型的可解释性,通过特征选择、阈值推荐和规则压缩三个阶段增强解释性,实现理论与人类可理解的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12363 2026-05-13 cs.CY cs.HC 50%

Reimagining Assessment in the Age of Generative AI: Lessons from Open-Book Exams with ChatGPT

在生成式AI时代重新审视评估:来自使用ChatGPT的开放式考试的启示

Qusay H. Mahmoud

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 研究探讨学生在开放式考试中使用ChatGPT的交互模式,发现评估任务从生成答案转向验证答案有效性,强调推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏