arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2301.03094 2024-12-25 cs.AI 70%

A Divide-Align-Conquer Strategy for Program Synthesis

Jonas Witt, Sebastijan Dumančić, Tias Guns, Claus-Christian Carbon

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01829 2024-11-05 cs.LG 70%

Formal Theorem Proving by Rewarding LLMs to Decompose Proofs Hierarchically

Kefan Dong, Arvind Mahankali, Tengyu Ma

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.11456 2024-10-30 cs.AI cs.CY cs.MA 70%

Norms, Institutions, and Robots

Stevan Tomic, Federico Pecora, Alessandro Saffiotti

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 12 pages, 8 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06557 2024-02-12 cs.AI cs.IR 70%

The Quantified Boolean Bayesian Network: Theory and Experiments with a Logical Graphical Model

Gregory Coppola

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13710 2022-09-29 cs.AI 70%

Towards Human-Compatible XAI: Explaining Data Differentials with Concept Induction over Background Knowledge

Cara Widmer, Md Kamruzzaman Sarker, Srikanth Nadella, Joshua Fiechter, Ion Juvina, Brandon Minnery, Pascal Hitzler, Joshua Schwartz, Michael Raymer

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.02127 2021-07-06 cs.AI 70%

Addendum to "HTN Acting: A Formalism and an Algorithm"

Lavindra de Silva

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments This paper is a more detailed version of the following publication: Lavindra de Silva, "HTN Acting: A Formalism and an Algorithm", in Proceedings of AAMAS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14915 2021-06-01 cs.AI cs.HC 70%

SMASH: a Semantic-enabled Multi-agent Approach for Self-adaptation of Human-centered IoT

Hamed Rahimi, Iago Felipe Trentin, Fano Ramparany, Olivier Boissier

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Submitted to PAAMS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13567 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中出现的模块化认知架构

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。

Comments this https URL (https://pengrui-han.github.io/LLM_Modularity_Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23806 2026-07-28 cs.CL cs.AI cs.IR cs.LG cs.PF 新提交 67%

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此

Sietse Schelpe

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。

Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 67%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14126 2026-07-17 cs.AI cs.CL cs.LG 新提交 67%

Interpretable Language Model for Closed-Loop Type 1 Diabetes Control

用于闭环1型糖尿病控制的可解释语言模型

Maya Sarkar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09008 2026-07-15 cs.CL cs.AI cs.LG cs.LO 版本更新 67%

A Neurosymbolic Approach to Natural Language Formalization and Verification

一种用于自然语言形式化和验证的神经符号方法

Chenyang An, Sam Bayless, Stefano Buliani, Darion Cassel, Byron Cook, Duncan Clough, Rémi Delmas, Nafi Diallo, Ferhat Erata, Nick Feng, Dimitra Giannakopoulou, Aman Goel, Aditya Gokhale, Joe Hendrix, Victor Heorhiadi, Marc Hudak, Dejan Jovanović, Andrew M. Kent, Benjamin Kiesl-Reiter, Jeffrey J. Kuna, Nadia Labai, Joseph Lilien, Divya Raghunathan, Zvonimir Rakamarić, Niloofar Razavi, Michael Tautschnig, Ali Torkamani, Nathaniel Weir, Michael W. Whalen, Jianan Yao

机构 * Amazon Web Services(亚马逊网络服务) University College London(伦敦大学学院) University of Toronto(多伦多大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27229 2026-07-08 cs.CL cs.AI cs.LG cs.NE 新提交 67%

CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention

CARVE: 内容感知循环与值效率的分块并行线性注意力

Sayak Dutta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CARVE模型,通过仅在键轴上擦除解决delta规则架构的三个耦合缺陷,实现WY形式分块求解器,在1.3B参数上取得WikiText困惑度15.72,优于GDN-2。

Comments 33 pages, 3 figures, 11 tables, 5 algorithms (incl. appendices with full proofs and Triton kernel pseudocode). Single-author preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14688 2026-06-15 cs.LG cs.AI cs.CL cs.DS 新提交 67%

Flood and Harvest: The Provable Necessity of Trivia for Generating Valuable Mathematics via the Lens of Language Generation in the Limit

洪流与收获:通过极限语言生成视角证明琐碎知识对于生成有价值数学的必要性

Xiaoyu Li, Andi Han, Dai Shi, Zheng Gao, Jiaojiao Jiang, Junbin Gao

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) University of Cambridge(剑桥大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过极限语言生成模型证明,在形式化数学生成中,验证器无法替代品味:覆盖未记录的有价值数学必须产生无限但渐近可忽略的琐碎语句,这是理论上的必然。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24597 2026-05-26 cs.AI cs.CL cs.LG 67%

Learning to Reason Efficiently with A* Post-Training

学习通过A*后训练进行高效推理

Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov, Mrinmaya Sachan, Bernhard Schölkopf, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所) Purdue University(普渡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过A*搜索算法指导LLM生成正确且高效的推理步骤,提出监督微调和强化学习两种训练方法,在1B-3B参数模型上显著提升推理准确性和效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24462 2026-05-26 cs.CE 67%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15878 2026-05-19 cs.LO cs.AI cs.CL cs.LG 67%

Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs

Lean 与理论计算机科学的交汇:形式-非形式对中可扩展的定理证明挑战合成

Terry Jingchen Zhang, Wenyuan Jiang, Rongchuan Liu, Yisong Wang, Junran Yang, Ning Wang, Nicole Ni, Yinya Huang, Mrinmaya Sachan

机构 * D-CHAB, ETH Zurich, Zurich, Switzerland. D-INFK, ETH Zurich, Zurich, Switzerland. ETH AI Center, Zurich, Switzerland. University of Pennsylvania, PA, USA. Independent Researcher.

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用理论计算机科学作为可扩展的严谨证明问题来源,通过算法定义自动生成大量挑战性定理-证明对,展示了在Busy Beaver问题和混合布尔算术问题上的应用,并揭示了自动定理证明在复杂问题上的局限性。

Comments Accepted to AI4MATH@ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21619 2026-05-12 cs.LG cs.AI cs.CL 67%

On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency

关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾

Yiming Wang, Zhuosheng Zhang, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。

Comments 44 pages, 66 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06673 2026-05-11 cs.CL cs.AI cs.LG 67%

Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

领域级元认知监控在前沿大语言模型中的应用:一个33模型图谱

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究员)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过33个前沿LLM在MMLU基准领域中的表现,揭示了元认知评分掩盖的领域级差异,发现应用/专业知识领域监控效果最佳,而形式推理和自然科学领域最难,且中等难度领域无显著差异。

Comments 25 pages, 7 figures, 1 supplementary table. Code and data: https://github.com/synthiumjp/metacognitive-profile-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO 67%

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17270 2026-04-14 cs.LG cs.AI cs.CL 67%

Understanding Generalization in Role-Playing Models via Information Theory

通过信息论理解角色扮演模型的泛化能力

Yongqi Li, Hao Lang, Fei Huang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息理论提出R-EMID指标,分析角色扮演模型在分布偏移下的泛化问题,提出协同强化学习框架提升对话生成概率,发现用户偏移对泛化影响最大。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09917 2026-02-03 cs.SE 67%

Enhancing LLM-based Specification Generation via Program Slicing and Logical Deletion

通过程序切片和逻辑删除增强基于LLM的规范生成

Zehan Chen, Long Zhang, Zhiwei Zhang, JingJing Zhang, Ruoyu Zhou, Yulong Shen, JianFeng Ma, Lin Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

AI总结 SLD-Spec通过程序切片和逻辑删除提升LLM生成规范的准确性和完整性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00337 2026-02-03 cs.DL 67%

Smarter AI Through Prompt Engineering: Insights and Case Studies from Data Science Application

通过提示工程实现更智能的AI:来自数据科学应用的洞察与案例研究

Snehasish Paul, Rohit Kumar, Laxman Das

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文通过提示工程在不同领域的应用案例,展示其提升AI性能的潜力及方法论有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08653 2025-12-29 cs.LG cs.AI cs.CL cs.NE 67%

Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion

通过课程指导自适应递归加速小型递归模型的训练速度

Kaleem Ullah Qasim, Jiashu Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CGAR通过课程指导自适应递归方法,提升小型递归模型训练效率,实现加速训练和保持模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07927 2025-12-16 cs.AI cs.CL cs.LG 67%

Solving Inequality Proofs with Large Language Models

用大语言模型解决不等式证明

Pan Lu, Jiayi Sheng, Luna Lyu, Jikai Jin, Tony Xia, Alex Gu, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。

Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17645 2025-11-26 cs.LG cs.AI cs.CL 67%

BlockCert: Certified Blockwise Extraction of Transformer Mechanisms

BlockCert: Transformer机制的认证分块提取

Sandro Andric

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BlockCert通过认证分块提取Transformer机制,提供可验证的误差界和覆盖率指标,实验证明其在多个模型上有效且具有实际应用价值。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17473 2025-11-24 cs.CL cs.AI cs.LG 67%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12829 2025-11-07 cs.CL cs.AI cs.LG cs.LO 67%

Mathematics with large language models as provers and verifiers

Hieu Le Duc, Leo Liberti

机构 * CNRS LIX Ecole Polytechnique, Institut Polytechnique de Paris(高等理工学院巴黎理工研究所)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15507 2025-10-14 cs.LG cs.AI cs.CL 67%

Steering LLMs for Formal Theorem Proving

Shashank Kirtania, Arun Iyer

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏