arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 6 篇

2605.13077 2026-08-04 cs.MA cs.AI 版本更新 79%

Counterfactual Reasoning for Causal Responsibility Attribution in Probabilistic Multi-Agent Systems

反事实推理在概率多智能体系统中的因果责任归因

Chunyan Mu, Muhammad Najib

机构 * University of Aberdeen(阿伯丁大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于反事实推理的因果责任归因方法,利用Shapley值确保公平性和一致性,构建了支持责任感知多智能体系统验证与策略推理的框架,并通过纳什均衡计算稳定策略配置。

Comments Accepted at IJCAI 2026. This is the full version containing all proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 57%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00981 2026-08-04 cs.AI 新提交 57%

Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

审计发现主张:面向智能体科学的双边准则,其负面侧可判定

Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出面向智能体科学的双边审计准则,通过实验揭示AI科学系统能力主张的夸大问题,证实智能体编写的程序在低计算量下可击败人类程序,但未明确可迁移的机制。

Comments 51 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09806 2026-08-04 cs.DL cond-mat.mtrl-sci cs.AI 版本更新 57%

An Autonomous Scientific Knowledge Generation Framework for AI-Driven Scientific Discovery

一种用于人工智能驱动科学发现的自主科学知识生成框架

Dibakar Datta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出自主科学知识生成框架,整合多种技术将科学出版物转化为适用于人工智能的知识库,以电光材料为例进行验证,实现从文献到知识库的转变,为人工智能驱动的科学发现提供了可扩展、领域独立的基础。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏