arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2604.18587 2026-06-01 cs.LG cs.AI cs.LO cs.PL 79%

Compile to Compress: Boosting Formal Theorem Provers by Compiler Outputs

编译以压缩:通过编译器输出提升形式定理证明器

Guchan Li, Rui Tian, Hongning Wang

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 代码与定理证明 :reasoning(abstract);test-time compute(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 利用编译器将大量证明尝试压缩为结构化失败模式,提出一种学习-精炼框架,通过树搜索基于验证器反馈局部修正错误,在可比测试时预算下在PutnamBench上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12603 2025-09-17 cs.CL cs.AI 79%

EconProver: Towards More Economical Test-Time Scaling for Automated Theorem Proving

Mukai Li, Linfeng Song, Zhenwen Liang, Jiahao Xu, Shansan Gong, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent(腾讯) The University of Hong Kong(香港大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14026 2025-03-24 cs.CL cs.AI 79%

Uncovering Latent Chain of Thought Vectors in Language Models

Jason Zhang, Scott Viteri

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments This work was presented at the Workshop on Neural Network Weights as a New Data Modality at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 78%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25996 2026-07-29 cs.SE 新提交 78%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17981 2026-07-27 cs.SE 版本更新 78%

Planning to Hammer: Difficulty-Aware Decomposition for Automating Rocq Proofs

规划锤击:面向自动化Rocq证明的难度感知分解

Ning Zhang, Nongyu Di, Zenan Li, Yuan Yao, Xiaoxing Ma

专题命中 代码与定理证明 :planning(title,abstract)

AI总结 提出Quarry框架,通过LLM规划证明分解并利用难度模型排序子目标,结合CoqHammer自动证明,在Rocq基准测试中成功率提升7%-13%。

Comments 26 pages, 8 figures; submitted to OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01223 2026-07-21 cs.AI cs.CL cs.LG cs.LO cs.SE 版本更新 78%

Theoria: Rewrite-Acceptability Verification over Informal Reasoning States

Theoria: 非正式推理状态上的重写-可接受性验证

Michael Saldivar, Ben Slivinski

机构 * Independent Researchers(独立研究者)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Theoria验证架构,通过将候选解重写为带显式理由的序列化状态转换并验证变更完整性,在HLE-Verified Gold上以91.4%精确率认证105个问题,优于整体式LLM评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08458 2026-06-09 cs.RO 新提交 78%

Personalized and Robust Proactive Robot Assistance with Uncertainty-Guided LLM Reasoning

个性化且鲁棒的主动机器人辅助:基于不确定性引导的大语言模型推理

Alvaro Gonzalez, M. H. Hasan Shovo, Ali Ayub

机构 * Concordia University(康考迪亚大学)

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 提出GLOBE框架,结合n-gram马尔可夫模型与不确定性引导的大语言模型推理,在家庭环境中实现高效鲁棒的主动机器人辅助,并在HOMER-Noise数据集上验证了其性能与效率。

Comments Accepted to the 2026 IEEE 35th International Conference on Robot and Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.02770 2026-06-04 cs.LO cs.SE cs.SY eess.SY 78%

Proceedings 2nd International Workshop on Causal Reasoning for Embedded and safety-critical Systems Technologies

第二届嵌入式和安全关键系统技术因果推理国际研讨会论文集

Alex Groce, Stefan Leue

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文探讨了复杂嵌入式和安全关键系统中因果推理的方法,旨在促进不同领域研究者之间的交流,以提升关键系统故障根本原因分析的科学性。

Journal ref EPTCS 259, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.04595 2026-06-02 econ.TH 78%

Measuring Information Burden: From Coalition-Based Reasoning to the Price System

衡量信息负担:从基于联盟的推理到价格体系

Shuige Liu

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文通过形式化框架衡量价格体系节省的信息量,证明在可转移效用博弈中,核心与一致同意等价所需的最小信息结构是每个联盟至少被其一个成员所知,且平均每代理信息负担随经济规模指数增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18384 2026-05-27 cs.RO cs.FL 78%

LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback

LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划

Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin, Zhiwen Fan, Li Yin, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of São Paulo(圣保罗大学) Texas A&M University(德克萨斯A&M大学) SylphAI

专题命中 代码与定理证明 :planning(title,abstract)

AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。

Comments Presented at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17914 2026-05-19 cs.PL 78%

Guiding LLM-based Loop Invariant Synthesis via Feedback on Local Reasoning Errors

通过反馈局部推理错误引导基于LLM的循环不变式合成

Tianchi Li, Zhenyu Yan, Junhao Liu, Peng Di, Xin Zhang

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出了一种框架,通过形式验证LLM的思考过程并检测局部推理错误,为基于LLM的循环不变式合成提供建设性反馈,从而提高合成效果。

Comments Accepted by ACM Transactions on Programming Languages and Systems (TOPLAS). DOI: 10.1145/3806652

Journal ref ACM Trans. Program. Lang. Syst. 48, 2, Article 8 (May 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12881 2026-04-15 cs.SE 78%

Evaluating LLMs Code Reasoning Under Real-World Context

评估大语言模型在现实世界上下文中的代码推理能力

Changshu Liu

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出R2Eval1基准测试,包含135个来自十个广泛使用的Python项目的代码推理问题,通过序列化复合和自定义类型,更真实地评估LLM的通用性。

Comments Accepted by ICES SRC (ACM Student Research Competition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV 78%

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25565 2026-03-27 cs.CV 78%

GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

GeoHeight-Bench:迈向遥感中基于高度的多模态推理

Xuran Hu, Zhitong Xiong, Zhongcheng Hong, Yifang Ban, Xiaoxiang Zhu, Wufan Zhao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University of Munich(慕尼黑工业大学)

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23470 2026-03-25 cs.SE 78%

ConceptCoder: Improve Code Reasoning via Concept Learning

ConceptCoder: 通过概念学习提升代码推理

Md Mahbubur Rahman, Hengbo Tong, Wei Le

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 ConceptCoder通过学习代码概念提升代码推理能力,在漏洞检测任务中显著提高F1值,优于现有方法,并扩展至分支预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19858 2026-03-23 cs.RO cs.MA 78%

Beyond detection: cooperative multi-agent reasoning for rapid onboard EO crisis response

超越检测:用于快速在轨遥感危机响应的协作多智能体推理

Alejandro D. Mousist, Pedro Delgado de Robles Martín, Raquel Lladró Climent, Julian Cobos Aparicio

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出了一种分层多智能体架构,用于在轨遥感处理,在资源和带宽受限条件下,通过协调专用AI智能体实现互补多模态观测的利用,减少计算开销并保持决策一致性。

Comments Accepted for presentation at the ESA's 4S Symposium 2026 Conference (see https://atpi.eventsair.com/4s-symposium-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13574 2026-02-17 cs.SE cs.CR 78%

Execution-State-Aware LLM Reasoning for Automated Proof-of-Vulnerability Generation

面向执行状态的LLM推理用于自动化漏洞证明生成

Haoyu Li, Xijia Che, Yanhao Wang, Xiaojing Liao, Luyi Xing

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。

Comments Version 1.0 (13 pages, 7 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20613 2025-11-25 cs.CL cs.AI cs.LG cs.LO 78%

REAL-Prover: Retrieval Augmented Lean Prover for Mathematical Reasoning

REAL-Prover:基于检索的Lean证明器用于数学推理

Ziju Shen, Naohao Huang, Fanyi Yang, Yutong Wang, Guoxiong Gao, Tianyi Xu, Jiedong Jiang, Wanyi He, Pu Yang, Mengzhou Sun, Haocheng Ju, Peihao Wu, Bryan Dai, Bin Dong

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Ubiquant(Ubiquant公司) Beijing International Center for Mathematical Research(北京国际数学研究中心)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 REAL-Prover基于检索增强的Lean证明器,通过微调大型语言模型和检索系统,在数学推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17548 2025-07-24 cs.SE 78%

CodeReasoner: Enhancing the Code Reasoning Ability with Reinforcement Learning

Lingxiao Tang, He Ye, Zhongxin Liu, Xiaoxue Ren, Lingfeng Bao

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13487 2024-10-18 cs.CE 78%

Automated Reasoning in Systems Biology: a Necessity for Precision Medicine

Pedro Zuidberg Dos Martires, Vincent Derkinderen, Luc De Raedt, Marcus Krantz

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10186 2024-09-20 cs.NI 78%

Toward Explainable Reasoning in 6G: A Proof of Concept Study on Radio Resource Allocation

Farhad Rezazadeh, Sergio Barrachina-Muñoz, Hatim Chergui, Josep Mangues, Mehdi Bennis, Dusit Niyato, Houbing Song, Lingjia Liu

专题命中 代码与定理证明 :reasoning(title,abstract)

Comments 21 pages, 11 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.10363 2018-12-27 cs.LO 78%

Reasoning About Safety-Critical Information Flow Between Pilot and Computer

Seth Ahrenbach

专题命中 代码与定理证明 :reasoning(title,abstract)

Comments Published in the Proceedings from the 9th International Symposium of NASA Formal Methods, 2017

Journal ref In: Barrett C., Davies M., Kahsai T. (eds) NASA Formal Methods. NFM 2017. Lecture Notes in Computer Science, vol 10227. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
1102.3341 2011-04-29 cs.MA 78%

Reasoning about Social Choice Functions

Nicolas Troquard, Wiebe van der Hoek, Michael Wooldridge

专题命中 代码与定理证明 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 77%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00003 2025-12-03 cs.CC cs.DS cs.LG 77%

Efficient Turing Machine Simulation with Transformers

基于变压器的高效图灵机模拟

Qian Li, Yuyi Wang

机构 * Shenzhen International Center For Industrial And Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究 institute) CRRC Zhuzhou Institute(CRRC 长沙研究所) Tengen Intelligence Institute(腾根智能研究院)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出了一种基于变压器的高效图灵机模拟方法,通过优化上下文窗口和CoT步骤,实现了更高效的通用计算。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18883 2025-11-10 cs.AI 77%

Introducing LongCat-Flash-Thinking: A Technical Report

Meituan LongCat Team, Anchun Gui, Bei Li, Bingyang Tao, Bole Zhou, Borun Chen, Chao Zhang, Chao Zhang, Chengcheng Han, Chenhui Yang, Chi Zhang, Chong Peng, Chuyu Zhang, Cong Chen, Fengcun Li, Gang Xu, Guoyuan Lin, Hao Jiang, Hao Liang, Haomin Fu, Haoxiang Ma, Hong Liu, Hongyan Hao, Hongyin Tang, Hongyu Zang, Hongzhi Ni, Hui Su, Jiahao Liu, Jiahuan Li, Jialin Liu, Jianfei Zhang, Jianhao Xu, Jianing Wang, Jiaqi Sun, Jiaqi Zhang, Jiarong Shi, Jiawei Yang, Jingang Wang, Jinrui Ding, Jun Kuang, Jun Xu, Ke He, Kefeng Zhang, Keheng Wang, Keqing He, Li Wei, Liang Shi, Lin Qiu, Lingbin Kong, Lingchuan Liu, Linsen Guo, Longfei An, Mai Xia, Meng Zhou, Mengshen Zhu, Peng Pei, Pengcheng Jia, Qi Gu, Qi Guo, Qiong Huang, Quan Chen, Quanchi Weng, Rongxiang Weng, Ruichen Shao, Rumei Li, Shanglin Lei, Shuai Du, Shuaikang Liu, Shuang Zhou, Shuhao Hu, Siyu Xu, Songshan Gong, Tao Liang, Tianhao Hu, Wei He, Wei Shi, Wei Wang, Wei Wu, Wei Zhuo, Weifeng Tang, Wenjie Shi, Wenlong Zhu, Xi Su, Xiangcheng Liu, Xiangyu Xi, Xiangzhou Huang, Xiao Liu, Xiaochen Jiang, Xiaowei Shi, Xiaowen Shi, Xiaoyu Li, Xin Chen, Xinyue Zhao, Xuan Huang, Xuemiao Zhang, Xuezhi Cao, Xunliang Cai, Yajie Zhang, Yang Chen, Yang Liu, Yang Liu, Yang Zheng, Yaoming Wang, Yaqi Huo, Yerui Sun, Yifan Lu, Yiyang Li, Youshao Xiao, Yuanzhe Lei, Yuchen Xie, Yueqing Sun, Yufei Zhang, Yuhuai Wei, Yulei Qian, Yunke Zhao, Yuqing Ding, Yuwei Jiang, Zhaohua Yang, Zhengyu Chen, Zhijian Liu, Zhikang Xia, Zhongda Su, Ziran Li, Ziwen Wang, Ziyuan Zhuang, Zongyu Wang, Zunyuan Yang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06736 2025-10-31 cs.CL 77%

Are LLMs Rigorous Logical Reasoners? Empowering Natural Language Proof Generation by Stepwise Decoding with Contrastive Learning

Ying Su, Mingwen Liu, Zhijiang Guo

机构 * South China University of Technology(华南理工大学) Likelihood Lab(Likelihood实验室) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL

Comments 15 pages, 2 figures, 11 tables. Accepted by AACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02318 2025-01-06 cs.SE cs.AI cs.LO cs.PL 77%

Evaluating the Ability of Large Language Models to Generate Verifiable Specifications in VeriFast

Wen Fan, Marilyn Rego, Xin Hu, Sanya Dod, Zhaorui Ni, Danning Xie, Jenna DiVincenzo, Lin Tan

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13353 2026-07-14 cs.CL cs.LG cs.SE 版本更新 76%

Sense and Sensitivity: Examining the Influence of Semantic Recall on Long Context Code Understanding

感知与敏感性:探讨语义回忆对长上下文代码推理的影响

Adam Štorek, Mukur Gupta, Samira Hajizadeh, Prashast Srivastava, Suman Jana

机构 * Columbia University(哥伦比亚大学)

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本文探讨了语义回忆对长上下文代码推理的影响,通过评估10种先进LLM发现,前沿模型在词汇回忆上表现优异,但语义回忆在长上下文中央位置时显著下降。引入语义回忆敏感性指标,提出SemTrace任务,展示LLM在长上下文中的位置效应。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏