arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-21 至 2026-04-21 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 8 篇

2604.16584 2026-04-21 cs.SE cs.AI cs.PL 83%

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

专题命中 代码与定理证明 :verifier(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17010 2026-04-21 cs.CL cs.AI cs.LG cs.PL 82%

Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification

通过形式验证的语义等价自博弈提升大语言模型代码推理

Antonio Valerio Miceli Barone, Poon Tsz Nok

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于形式验证的语义等价自博弈框架,利用对抗训练提升代码推理能力,通过验证等价性与非等价性,释放OpInstruct-HSx数据集,实验显示在EquiBench上提升13.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14628 2026-04-21 cs.PL cs.AI cs.CR cs.LO 79%

s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs

s2n-bignum-bench:评估LLM低级代码推理能力的实用基准

Balaji Rao, John Harrison, Soonho Kong, Juneyoung Lee, Carlo Lipizzi

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出s2n-bignum-bench基准,用于评估LLM在工业级低级密码学汇编代码中的定理证明能力,通过形式化验证挑战证明生成。

Comments Accepted as a Workshop paper at AIPV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17252 2026-04-21 cs.CL cs.AI cs.RO 62%

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

看见并不等于相信:通过主动干预缓解具身智能体中的信念惯性

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过主动干预缓解具身智能体中的信念惯性问题,引入EVU机制提升任务成功率。

Comments Accepted by ACL2026 Fingdings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18404 2026-04-21 cs.AI 61%

Six Llamas: Comparative Religious Ethics Through LoRA-Adapted Language Models

六头 llama:通过 LoRA 调整的语言模型进行比较宗教伦理研究

Chad Coleman, W. Russell Neuman, Manan Shah, Ali Dasdan, Matthew Crispi, Morris Chiang, Zack Leitman, Mustafa Poonawala

机构 * Meta

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文通过 LoRA 调整的语言模型比较不同宗教文本对伦理推理的影响,发现调整模型在伦理推理上与基础模型有系统性差异,并在不同温度设置下表现出稳定性与多样性。

Comments 51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17229 2026-04-21 cs.AI 57%

Yanasse: Finding New Proofs from Deep Vision's Analogies, Part 1

Yanasse:从深度视觉类比中寻找新证明,第一部分

Alexandre Linhares

机构 * Getulio Vargas Foundation and ARGO LABS(格尔维拉斯基金会和ARGO实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Yanasse通过将证明策略模式从结构上遥远的数学领域转移到另一个领域,发现新证明。该方法在概率与表示论之间应用,生成4个Lean验证的新证明,证明编译无错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01645 2026-04-21 cs.CR 50%

Contextualizing Sink Knowledge for Java Vulnerability Discovery

在Java漏洞发现中 contextualizing sink knowledge

Fabian Fleischer, Cen Zhang, Joonun Jang, Jeongin Cho, Meng Xu, Taesoo Kim

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 GONDAR框架通过利用sink API语义进行针对性漏洞发现,通过CWE扫描和LLM静态过滤识别可利用的sink调用点,并通过探索和利用代理协作发现更多漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16524 2026-04-21 cs.CR 50%

Anumati: Proof of Adherence as a Formal Consent Model for Autonomous Agent Protocols

Anumati:作为自主代理协议的合规性证明形式化同意模型

Ravi Kiran Kadaboina

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出一种形式化同意模型,用于自主代理协议中的合规性证明,通过三个原始构件实现版本化、只追加的同意模型,并将其扩展到两种常用代理协议中。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏