arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2603.06974 2026-03-10 cs.CL cs.AI cs.LO 62%

Elenchus: Generating Knowledge Bases from Prover-Skeptic Dialogues

Elenchus:从证人-怀疑者对话生成知识库

Bradley P. Allen

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Elenchus通过证人-怀疑者对话与LLM交互,利用非单调多后件逻辑显式化知识库构建,实现从对话到形式推理的端到端整合。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18764 2026-03-06 cs.AI cs.CL 62%

The Convergence of Schema-Guided Dialogue Systems and the Model Context Protocol

模式引导对话系统与模型上下文协议的收敛

Andreas Schlapbach

机构 * SBB-IT

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析模式引导对话系统与模型上下文协议的收敛,提出五条模式设计原则,揭示了SGD与MCP的内在联系及软件3.0中的关键监督机制。

Comments 18 sections, 4 figures, 7 tables, 40 references. Original research presenting: (1) formal framework mapping Schema-Guided Dialogue principles to Model Context Protocol concepts, (2) five foundational design principles for LLM-native schema authoring, (3) architectural patterns for secure, scalable agent orchestration. Research supported by SBB (Swiss Federal Railways)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04372 2026-03-06 cs.SE cs.AI cs.LG 62%

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

评估代码更改对大型语言模型故障定位性的影响

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。

Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02228 2026-03-04 cs.LG cs.AI 62%

Neural Paging: Learning Context Management Policies for Turing-Complete Agents

神经分页:为图灵完备智能体学习上下文管理策略

Liang Chen, Qi Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经分页架构,通过解耦符号推理与信息资源管理,提升图灵完备智能体的上下文处理效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20666 2026-03-03 cs.CL cs.AI 62%

Cognitive models can reveal interpretable value trade-offs in language models

认知模型可以揭示语言模型中的可解释价值权衡

Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman

机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Google DeepMind(谷歌DeepMind) Department of Psychology, Harvard University(哈佛大学心理学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 62%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15940 2026-02-24 cs.LG cs.AI 62%

Lean Finder: Semantic Search for Mathlib That Understands User Intents

Lean Finder: 用于Mathlib的语义搜索,能理解用户意图

Jialin Lu, Kye Emond, Kaiyu Yang, Swarat Chaudhuri, Weiran Sun, Wuyang Chen

机构 * Simon Fraser University(西蒙·弗雷泽大学) University of Waterloo(滑铁卢大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Lean Finder通过语义搜索和用户意图理解,提升了数学家在Lean和mathlib中的搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18346 2026-02-23 cs.CL cs.AI 62%

Vichara: Appellate Judgment Prediction and Explanation for the Indian Judicial System

Vichara:印度司法系统上诉判决预测与解释

Pavithra PM Nair, Preethu Rose Anish

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Vichara通过结构化方法预测和解释印度司法系统中的上诉判决,利用大型语言模型在两个数据集上取得优异表现,尤其在可解释性方面表现突出。

Journal ref AI and Law @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02515 2026-02-19 cs.CL cs.LG 62%

PoeTone: A Framework for Constrained Generation of Structured Chinese Songci with LLMs

PoeTone: 一个用于基于LLM生成结构化中文词的约束生成框架

Zhan Qu, Shuzhou Yuan, Michael Färber

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 PoeTone框架通过约束生成和评估方法,提升LLM在生成结构化中文词中的表现,实现正式符合度提升5.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19923 2026-02-18 cs.AI cs.LG 62%

Prover Agent: An Agent-Based Framework for Formal Mathematical Proofs

Prover Agent:一个基于代理的正式数学证明框架

Kaito Baba, Chaoran Liu, Shuhei Kurita, Akiyoshi Sannai

机构 * The University of Tokyo, Tokyo, Japan(东京大学) National Institute of Informatics, Tokyo, Japan(日本信息处理学会) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(大型语言模型研究开发中心) Kyoto University, Kyoto, Japan(京都大学) Shiga University, Shiga, Japan(滋贺大学) RIKEN Center for Advanced General Intelligence for Science Program, Kobe, Japan(理化学研究所高级一般智能科学项目中心) National Institute of Science Technology Policy (NISTEP), Tokyo, Japan(科学与技术政策国立研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Prover Agent结合大语言模型与Lean,通过生成辅助引理提升形式证明效率,在MiniF2F和PutnamBench上取得新突破。

Comments 49 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06232 2026-02-09 cs.LG cs.AI cs.GT cs.MA 62%

RuleSmith: Multi-Agent LLMs for Automated Game Balancing

RuleSmith:多智能体LLM用于自动化游戏平衡

Ziyao Zeng, Chen Liu, Tianyu Liu, Hao Wang, Xiatao Sun, Fengyu Yang, Xiaofeng Liu, Zhiwen Fan

机构 * Yale University(耶鲁大学) Texas A\&M University(德克萨斯农工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RuleSmith利用多智能体LLM实现自动化游戏平衡,通过贝叶斯优化和自适应采样高效搜索参数空间,实现高平衡配置和可解释规则调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22352 2026-02-02 cs.LG cs.AI 62%

Recoverability Has a Law: The ERR Measure for Tool-Augmented Agents

可恢复性有定律:工具增强智能体的ERR度量

Sri Vatsa Vuddanti, Satwik Kumar Chittiprolu

机构 * Sri Vatsa Vuddanti(独立研究者) Satwik Kumar Chittiprolu(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种预测理论,通过预期恢复遗憾(ERR)与效率分数(ES)的关系,揭示了语言模型智能体在工具使用中的可恢复性遵循可测量的定律。

Comments Preprint for ICML Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12869 2026-01-27 cs.LG cs.AI cs.DC cs.IT cs.MA math.IT 62%

On the Fundamental Limits of LLMs at Scale

在大规模下的大语言模型根本限制

Muhammad Ahmed Mohsin, Muhammad Umer, Ahsan Bilal, Zeeshan Memon, Muhammad Ibtsaam Qadir, Sagnik Bhattacharya, Hassan Rizwan, Abhiram R. Gorle, Maahe Zehra Kazmi, Nukhba Amir, Ali Subhan, Muhammad Usman Rafique, Zihao He, Pulkit Mehta, Muhammad Ali Jamshed, John M. Cioffi

机构 * Stanford University(斯坦福大学) The University of Oklahoma(俄克拉荷马大学) Emory University(埃默里大学) Purdue University(普渡大学) UC Riverside(加州大学河滨分校) UC Berkeley(加州大学伯克利分校) Khyber Medical University(克希伯医学大学) Universtat Pompeu Fabra(庞培法华大学) Zoox(Zoox公司) Meta Google DeepMind(谷歌DeepMind) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Glasgow(格拉斯哥大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大规模大语言模型的根本限制,提出统一框架分析计算、信息和学习的基础限制,并提供缓解方法。

Comments Submitted to TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22846 2026-01-27 cs.LG cs.AI cs.LO cs.SE 62%

RocqStar: Leveraging Similarity-driven Retrieval and Agentic Systems for Rocq generation

RocqStar: 利用相似性驱动检索与智能体系统进行Rocq生成

Andrei Kozyrev, Nikita Khramov, Gleb Solovev, Anton Podkopaev

机构 * JetBrains Research(JetBrains研究)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RocqStar通过结合相似性驱动检索和智能体系统,显著提升Rocq证明生成的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15737 2026-01-23 cs.AI cs.CL 62%

PhysProver: Advancing Automatic Theorem Proving for Physics

PhysProver: 推动物理领域自动定理证明的发展

Hanning Zhang, Ruida Wang, Rui Pan, Wenyuan Wang, Bingxu Meng, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Rutgers University(罗格斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PhysProver通过结合可验证语言和强化学习,提升物理领域形式化定理证明的效率和效果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09709 2026-01-22 cs.CL cs.LG 62%

Large Language Models Encode Semantics and Alignment in Linearly Separable Representations

大语言模型在线性可分的表示中编码语义和对齐

Baturay Saglam, Paul Kassianik, Blaine Nelson, Sajana Weerawardhena, Yaron Singer, Amin Karbasi

机构 * Yale University(耶鲁大学) Foundation AI – Cisco Systems Inc(Foundation AI – 卡西欧系统公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究发现大语言模型通过线性可分的表示编码语义和对齐,提出基于潜在空间的MLP探测器有效提升安全防护。

Comments IJCNLP and the Asian Chapter of ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11622 2026-01-21 cs.AI cs.LG 62%

Dynamical Systems Analysis Reveals Functional Regimes in Large Language Models

动力系统分析揭示大语言模型中的功能模式

Hassan Ugail, Newton Howard

机构 * Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心) University of Bradford(布拉德福德大学) School of Individualised Study(个性化学习学院) Rochester Institute of Technology(罗切斯特技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过动力系统分析揭示大语言模型在不同功能模式中的计算组织差异,提出一种基于时间序列的动态度量指标,用于评估模型内部动态特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10077 2026-01-21 cs.NE cs.AI cs.DS cs.LG 62%

Predictive Spike Timing Enables Distributed Shortest Path Computation in Spiking Neural Networks

预测性脉冲时间使分布式最短路径计算在脉冲神经网络中成为可能

Simen Storesund, Kristian Valset Aars, Robin Dietrich, Nicolai Waniek

机构 * Department of Mathematical Sciences(数学科学系) Norwegian University of Science and Technology(挪威科学与技术大学) School of Computation, Information and Technology(计算、信息与技术学院) Technical University Munich(慕尼黑技术大学)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种基于生物合理机制的最短路径计算算法,利用脉冲时间巧合实现分布式计算,为生物和人工系统中的复杂问题解决提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06478 2026-01-06 cs.LG cs.AI 62%

Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift

通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00816 2026-01-06 cs.AI cs.CR cs.LG 62%

MathLedger: A Verifiable Learning Substrate with Ledger-Attested Feedback

MathLedger: 一种具有账本证明反馈的可验证学习基础

Ismail Ahmad Abdullah

机构 * CNU(中国矿业大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 MathLedger通过整合形式验证、密码学证明和学习动态,提供一种可验证学习的基础,实现可审计的机器认知系统。

Comments 14 pages, 1 figure, 2 tables, 2 appendices with full proofs. Documents v0.9.4-pilot-audit-hardened audit surface with fail-closed governance, canonical JSON hashing, and artifact classification. Phase I infrastructure validation; no capability claims

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17904 2025-12-16 cs.CR cs.AI cs.CL 62%

BreakFun: Jailbreaking LLMs via Schema Exploitation

BreakFun: 通过模式利用对LLM进行劫持

Amirkia Rafiei Oskooei, Mehmet S. Aktas

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 BreakFun通过利用LLM对结构模式的遵守能力,揭示了其在劫持攻击中的脆弱性,并提出对抗性提示解构作为缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15809 2025-12-02 cs.CL cs.AI cs.DB 62%

Chain-of-Query: Unleashing the Power of LLMs in SQL-Aided Table Understanding via Multi-Agent Collaboration

链式查询:通过多智能体协作释放LLM在SQL辅助表格理解中的潜力

Songyuan Sui, Hongyi Liu, Serena Liu, Li Li, Soo-Hyun Choi, Rui Chen, Xia Hu

机构 * Rice University(里士大学) Samsung Electronics America(三星电子美国分公司) Warner Bros. Discovery(华纳兄弟发现)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 链式查询通过多智能体协作提升SQL辅助表格理解的准确性与有效性

Comments AACL 2025 Main Conference (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21050 2025-11-27 cs.LG cs.AI stat.ML 62%

Breaking the Safety-Capability Tradeoff: Reinforcement Learning with Verifiable Rewards Maintains Safety Guardrails in LLMs

打破安全性与能力的权衡:具有可验证奖励的强化学习在LLMs中维持安全护栏

Dongkyu Derek Cho, Huan Song, Arijit Ghosh Chowdhury, Haotian An, Yawei Wang, Rohit Thekkanal, Negin Sokhandan, Sharlina Keshava, Hannah Marlowe

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过可验证奖励的强化学习方法,在提升LLM推理能力的同时维持安全性,挑战了传统安全性与能力权衡的假设。

Comments AAAI-26 Workshop on Post-AI Formal Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11770 2025-11-18 cs.AI cs.LG 62%

Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction

Floris Vossebeld, Shenghui Wang

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science(电气工程、数学与计算机科学学院) University of Twente(特文特大学) Microsoft Netherlands(微软荷兰)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08274 2025-11-12 cs.AI cs.CL 62%

Multi-Agent GraphRAG: A Text-to-Cypher Framework for Labeled Property Graphs

Anton Gusarov, Anastasia Volkova, Valentin Khrulkov, Andrey Kuznetsov, Evgenii Maslov, Ivan Oseledets

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25427 2025-10-30 cs.CL cs.AI 62%

RLMEval: Evaluating Research-Level Neural Theorem Proving

Auguste Poiroux, Antoine Bosselut, Viktor Kunčak

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings. RLMEval benchmark released: https://github.com/augustepoiroux/RLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24115 2025-10-29 cs.AI cs.LG 62%

HistoLens: An Interactive XAI Toolkit for Verifying and Mitigating Flaws in Vision-Language Models for Histopathology

Sandeep Vissapragada, Vikrant Sahu, Gagan Raj Gupta, Vandita Singh

机构 * Indian Institute of Technology(印度理工学院) All India Institute of Medical Sciences(全印度医学科学研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17873 2025-10-28 cs.CL cs.AI cs.CE 62%

MOOSE-Chem3: Toward Experiment-Guided Hypothesis Ranking via Simulated Experimental Feedback

Wanhao Liu, Zonglin Yang, Jue Wang, Lidong Bing, Di Zhang, Dongzhan Zhou, Yuqiang Li, Houqiang Li, Erik Cambria, Wanli Ouyang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) MiroMind

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21894 2025-10-28 cs.CL cs.AI 62%

Understanding Network Behaviors through Natural Language Question-Answering

Mingzhe Xing, Chang Tian, Jianan Zhang, Lichen Pan, Peipei Liu, Zhaoteng Yan, Yinliang Yue

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01346 2025-10-14 cs.AI cs.CL 62%

Aristotle: IMO-level Automated Theorem Proving

Tudor Achim, Alex Best, Alberto Bietti, Kevin Der, Mathïs Fédérico, Sergei Gukov, Daniel Halpern-Leistner, Kirsten Henningsgard, Yury Kudryashov, Alexander Meiburg, Martin Michelsen, Riley Patterson, Eric Rodriguez, Laura Scharff, Vikram Shanker, Vladmir Sicca, Hari Sowrirajan, Aidan Swope, Matyas Tamas, Vlad Tenev, Jonathan Thomm, Harold Williams, Lawrence Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏