arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2606.14688 2026-06-15 cs.LG cs.AI cs.CL cs.DS 新提交 67%

Flood and Harvest: The Provable Necessity of Trivia for Generating Valuable Mathematics via the Lens of Language Generation in the Limit

洪流与收获:通过极限语言生成视角证明琐碎知识对于生成有价值数学的必要性

Xiaoyu Li, Andi Han, Dai Shi, Zheng Gao, Jiaojiao Jiang, Junbin Gao

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) University of Cambridge(剑桥大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过极限语言生成模型证明,在形式化数学生成中,验证器无法替代品味:覆盖未记录的有价值数学必须产生无限但渐近可忽略的琐碎语句,这是理论上的必然。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24597 2026-05-26 cs.AI cs.CL cs.LG 67%

Learning to Reason Efficiently with A* Post-Training

学习通过A*后训练进行高效推理

Andreas Opedal, Francesco Ignazio Re, Abulhair Saparov, Mrinmaya Sachan, Bernhard Schölkopf, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(图宾根智能系统研究所) Purdue University(普渡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过A*搜索算法指导LLM生成正确且高效的推理步骤,提出监督微调和强化学习两种训练方法,在1B-3B参数模型上显著提升推理准确性和效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24462 2026-05-26 cs.CE 67%

No Certificate, No Execution: Certified Traces as a Foundation for Trustworthy AI Agents

无证书,不执行:认证轨迹作为可信AI代理的基础

Xiao-Yang Liu Yanglet, Xiaodong Wang, Agostino Capponi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出提案-认证-执行(PCE)架构,通过可检查的认证轨迹确保AI代理仅在策略系统允许下执行,核心原则为“无证书,不执行”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15878 2026-05-19 cs.LO cs.AI cs.CL cs.LG 67%

Lean Meets Theoretical Computer Science: Scalable Synthesis of Theorem Proving Challenges in Formal-Informal Pairs

Lean 与理论计算机科学的交汇:形式-非形式对中可扩展的定理证明挑战合成

Terry Jingchen Zhang, Wenyuan Jiang, Rongchuan Liu, Yisong Wang, Junran Yang, Ning Wang, Nicole Ni, Yinya Huang, Mrinmaya Sachan

机构 * D-CHAB, ETH Zurich, Zurich, Switzerland. D-INFK, ETH Zurich, Zurich, Switzerland. ETH AI Center, Zurich, Switzerland. University of Pennsylvania, PA, USA. Independent Researcher.

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用理论计算机科学作为可扩展的严谨证明问题来源,通过算法定义自动生成大量挑战性定理-证明对,展示了在Busy Beaver问题和混合布尔算术问题上的应用,并揭示了自动定理证明在复杂问题上的局限性。

Comments Accepted to AI4MATH@ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21619 2026-05-12 cs.LG cs.AI cs.CL 67%

On the Overscaling Curse of Parallel Thinking: System Efficacy Contradicts Sample Efficiency

关于并行思维的过度扩展诅咒:系统效能与样本效率的矛盾

Yiming Wang, Zhuosheng Zhang, Rui Wang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究并行思维中系统效能与样本效率的矛盾,提出Latent Budget Predictor提升预算利用率,并引入Pre-decoding Budget Adaptation改进解码效率。

Comments 44 pages, 66 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06673 2026-05-11 cs.CL cs.AI cs.LG 67%

Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

领域级元认知监控在前沿大语言模型中的应用:一个33模型图谱

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究员)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过33个前沿LLM在MMLU基准领域中的表现,揭示了元认知评分掩盖的领域级差异,发现应用/专业知识领域监控效果最佳,而形式推理和自然科学领域最难,且中等难度领域无显著差异。

Comments 25 pages, 7 figures, 1 supplementary table. Code and data: https://github.com/synthiumjp/metacognitive-profile-atlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO 67%

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17270 2026-04-14 cs.LG cs.AI cs.CL 67%

Understanding Generalization in Role-Playing Models via Information Theory

通过信息论理解角色扮演模型的泛化能力

Yongqi Li, Hao Lang, Fei Huang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息理论提出R-EMID指标,分析角色扮演模型在分布偏移下的泛化问题,提出协同强化学习框架提升对话生成概率,发现用户偏移对泛化影响最大。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09917 2026-02-03 cs.SE 67%

Enhancing LLM-based Specification Generation via Program Slicing and Logical Deletion

通过程序切片和逻辑删除增强基于LLM的规范生成

Zehan Chen, Long Zhang, Zhiwei Zhang, JingJing Zhang, Ruoyu Zhou, Yulong Shen, JianFeng Ma, Lin Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

AI总结 SLD-Spec通过程序切片和逻辑删除提升LLM生成规范的准确性和完整性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00337 2026-02-03 cs.DL 67%

Smarter AI Through Prompt Engineering: Insights and Case Studies from Data Science Application

通过提示工程实现更智能的AI:来自数据科学应用的洞察与案例研究

Snehasish Paul, Rohit Kumar, Laxman Das

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文通过提示工程在不同领域的应用案例,展示其提升AI性能的潜力及方法论有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08653 2025-12-29 cs.LG cs.AI cs.CL cs.NE 67%

Accelerating Training Speed of Tiny Recursive Models with Curriculum Guided Adaptive Recursion

通过课程指导自适应递归加速小型递归模型的训练速度

Kaleem Ullah Qasim, Jiashu Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算机与人工智能学院,西南交通大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CGAR通过课程指导自适应递归方法,提升小型递归模型训练效率,实现加速训练和保持模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07927 2025-12-16 cs.AI cs.CL cs.LG 67%

Solving Inequality Proofs with Large Language Models

用大语言模型解决不等式证明

Pan Lu, Jiayi Sheng, Luna Lyu, Jikai Jin, Tony Xia, Alex Gu, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种非正式但可验证的任务公式化方法,通过IneqMath数据集和LLM-as-judge评估框架,揭示了大语言模型在解决不等式证明任务中的局限性及改进方向。

Comments 50 pages, 24 figures, accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07850 2025-11-27 cs.CL cs.AI cs.DB cs.LG 67%

Bring Your Own KG: Self-Supervised Program Synthesis for Zero-Shot KGQA

自带知识图谱:零样本知识图谱问答的自监督程序合成

Dhruv Agarwal, Rajarshi Das, Sopan Khosla, Rashmi Gangadharaiah

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) AWS AI Labs(AWS人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BYOKG通过自监督程序合成实现零样本知识图谱问答,利用探索机制和LLM生成查询程序,提升问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17645 2025-11-26 cs.LG cs.AI cs.CL 67%

BlockCert: Certified Blockwise Extraction of Transformer Mechanisms

BlockCert: Transformer机制的认证分块提取

Sandro Andric

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BlockCert通过认证分块提取Transformer机制,提供可验证的误差界和覆盖率指标,实验证明其在多个模型上有效且具有实际应用价值。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17473 2025-11-24 cs.CL cs.AI cs.LG 67%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12829 2025-11-07 cs.CL cs.AI cs.LG cs.LO 67%

Mathematics with large language models as provers and verifiers

Hieu Le Duc, Leo Liberti

机构 * CNRS LIX Ecole Polytechnique, Institut Polytechnique de Paris(高等理工学院巴黎理工研究所)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15507 2025-10-14 cs.LG cs.AI cs.CL 67%

Steering LLMs for Formal Theorem Proving

Shashank Kirtania, Arun Iyer

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18604 2025-09-24 cond-mat.mtrl-sci 67%

A closed-loop AI framework for hypothesis-driven and interpretable materials design

Kangyu Ji, Tianran Liu, Fang Sheng, Shaun Tan, Moungi Bawendi, Tonio Buonassisi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08641 2025-08-13 cs.LG cs.AI cs.CL 67%

MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time

Peter Phan, Dhruv Agarwal, Kavitha Srinivas, Horst Samulowitz, Pavan Kapanipathi, Andrew McCallum

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13158 2025-07-18 cs.LG cs.AI cs.CL 67%

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Hao Sun, Mihaela van der Schaar

机构 * Department of Applied Mathematics and Theoretical Physics(应用数学与理论物理系) University of Cambridge(剑桥大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06742 2025-07-10 cs.CR 67%

PenTest2.0: Towards Autonomous Privilege Escalation Using GenAI

Haitham S. Al-Sinani, Chris J. Mitchell

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

Comments 45 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12927 2025-06-17 cs.AI cs.CL cs.LG 67%

Sectoral Coupling in Linguistic State Space

Sebastian Dumbrava

机构 * Sebastian Dumbrava(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 56 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19188 2025-04-29 cs.LG cs.AI cs.CL cs.LO 67%

Hierarchical Attention Generates Better Proofs

Jianlong Chen, Chao Li, Yang Yuan, Andrew C Yao

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学智能技术学院长)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages with 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15929 2025-04-23 cs.AI cs.CL cs.LG 67%

Certifying Knowledge Comprehension in LLMs

Isha Chaudhary, Vedaant V. Jain, Gagandeep Singh

机构 * Siebel School of Computing and Data Science University of Illinois, Urbana-Champaign(计算机与数据科学学院 伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10144 2025-04-09 cs.CL cs.AI cs.LG cs.LO cs.PL 67%

NLP Verification: Towards a General Methodology for Certifying Robustness

Marco Casadio, Tanvi Dinkar, Ekaterina Komendantskaya, Luca Arnaboldi, Matthew L. Daggitt, Omri Isac, Guy Katz, Verena Rieser, Oliver Lemon

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10878 2025-02-28 cs.CL cs.AI cs.LG cs.LO 67%

Herald: A Natural Language Annotated Lean 4 Dataset

Guoxiong Gao, Yutong Wang, Jiedong Jiang, Qi Gao, Zihan Qin, Tianyi Xu, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10949 2025-02-13 cs.CL cs.AI cs.LG 67%

Representing Rule-based Chatbots with Transformers

Dan Friedman, Abhishek Panigrahi, Danqi Chen

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025. Code and data are available at https://github.com/princeton-nlp/ELIZA-Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04485 2025-02-10 cs.CL cs.AI cs.LG 67%

Active Task Disambiguation with LLMs

Katarzyna Kobalczyk, Nicolas Astorga, Tennison Liu, Mihaela van der Schaar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13952 2024-12-19 cs.CL cs.AI cs.LG 67%

Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation

Eleni Sgouritsa, Virginia Aglietti, Yee Whye Teh, Arnaud Doucet, Arthur Gretton, Silvia Chiappa

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10665 2024-11-19 cs.CR 67%

AutoIoT: Automated IoT Platform Using Large Language Models

Ye Cheng, Minghui Xu, Yue Zhang, Kun Li, Ruoxi Wang, Lian Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

Comments 12 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏