arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-19 至 2026-05-19 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 7 篇

2605.17914 2026-05-19 cs.PL 78%

Guiding LLM-based Loop Invariant Synthesis via Feedback on Local Reasoning Errors

通过反馈局部推理错误引导基于LLM的循环不变式合成

Tianchi Li, Zhenyu Yan, Junhao Liu, Peng Di, Xin Zhang

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出了一种框架,通过形式验证LLM的思考过程并检测局部推理错误,为基于LLM的循环不变式合成提供建设性反馈,从而提高合成效果。

Comments Accepted by ACM Transactions on Programming Languages and Systems (TOPLAS). DOI: 10.1145/3806652

Journal ref ACM Trans. Program. Lang. Syst. 48, 2, Article 8 (May 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15878 2026-05-19 cs.LO cs.AI cs.CL cs.LG 67%

Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs

Lean 与理论计算机科学的交汇:形式-非形式对中可扩展的定理证明挑战合成

Terry Jingchen Zhang, Wenyuan Jiang, Rongchuan Liu, Yisong Wang, Junran Yang, Ning Wang, Nicole Ni, Yinya Huang, Mrinmaya Sachan

机构 * D-CHAB, ETH Zurich, Zurich, Switzerland. D-INFK, ETH Zurich, Zurich, Switzerland. ETH AI Center, Zurich, Switzerland. University of Pennsylvania, PA, USA. Independent Researcher.

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用理论计算机科学作为可扩展的严谨证明问题来源,通过算法定义自动生成大量挑战性定理-证明对,展示了在Busy Beaver问题和混合布尔算术问题上的应用,并揭示了自动定理证明在复杂问题上的局限性。

Comments Accepted to AI4MATH@ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18133 2026-05-19 cs.CR cs.AI cs.HC cs.IR 57%

An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments

通过提示注入在黑盒聊天机器人环境中研究隐私泄露链的实证研究

Hongjang Yang, Hyunsik Na, Daeseon Choi

机构 * Department of Information Security(信息安全系) Soongsil University(松山大学) AI Safety Center(人工智能安全中心) Department of AI Software(人工智能软件系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过间接提示注入在黑盒聊天机器人环境中存在的隐私泄露攻击链,分析了攻击者如何通过构造看似无害的外部内容来劫持代理任务,并评估了新的提示注入技术'exemplification'的攻击成功率,最终展示了使用虚构个人信息的证明概念数据外泄链。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18073 2026-05-19 cs.SE cs.AI 57%

A-ProS: Towards Reliable Autonomous Programming Through Multi-Model Feedback

A-ProS:通过多模型反馈实现可靠的自主编程

Anika Tabassum, Md Sifat Hossain, Md. Fahim Arefin, Tariqul Islam, Tarannum Shaila Zaman

机构 * Dept. of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Dept. of Information Systems, University of Maryland, Baltimore County(马里兰大学巴尔的摩县信息学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出A-ProS,一种通过多模型反馈框架实现自主编程的AI代理,结合生成器和调试器,通过多轮反馈提升代码生成的准确性与效率,实验表明其在解决编程问题上具有显著优势。

Comments Accepted for Publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17255 2026-05-19 cs.AI math.OC 57%

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

CAM-Bench: 一个用于Lean中的计算与应用数学的基准测试

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

机构 * Fudan University(复旦大学) Qingdao University(青岛大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CAM-Bench,一个包含1000个Lean证明目标的基准测试,涵盖优化、数值线性代数和数值分析等领域,旨在补充现有形式化数学基准测试,通过针对依赖教科书概念和基本定理的应用数学问题进行评估。

Comments Preprint. 44 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08437 2026-05-19 cs.CL 57%

Large Language Models and Impossible Language Acquisition: "False Promise" or an Overturn of our Current Perspective towards AI

大语言模型与不可能的语言习得:"虚假承诺"或对当前人工智能观点的颠覆

Ziyan Wang, Longlong Ma

机构 * New Talent Academy(新人才学院) Institute of Software, University of Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 代码与定理证明 :self-correction(abstract);分类 cs.CL

AI总结 本文通过实验探讨大语言模型学习可能与不可能语言的能力,发现GPT-2模型在自然语言任务上表现优于不可能语言任务,而LSTM模型则无显著差异,挑战了Chomsky对AI的理性主义基础观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16640 2026-05-19 cs.LG 57%

Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders

在混合DeltaNet-注意力解码器中证明更短的scratchpad

Tomasz Steifer

机构 * Centre for Credible AI(可信人工智能中心) Warsaw University of Technology(华沙理工大学)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.LG

AI总结 研究混合递归-注意力解码器的表达能力,证明混合架构在模型表达性和效率上有优势,使用常数精度假设,Qwen风格的混合模型能以常数scratchpad解决parity-conditioned检索任务,而纯DeltaNet或纯注意力模型需多项式scratchpad。

Comments Under review at a ML conference

详情

展开后加载摘要…

URL PDF HTML 收藏