arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2601.11825 2026-01-21 cs.AI cs.IR 57%

AI Co-Scientist for Knowledge Synthesis in Medical Contexts: A Proof of Concept

医疗领域知识综合的AI合作者:概念验证

Arya Rahgozar, Pouria Mortezaagha

机构 * Methodological Implementation Research, Ottawa Hospital Research Institute(方法实施研究,渥太华医院研究所) School of Engineering Design and Teaching Innovation, University of Ottawa(工程设计与教学创新学院,渥太华大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出了一种基于PICOS的AI合作者,通过整合知识图谱和自然语言处理技术,提升医疗领域证据综合的可扩展性、透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17925 2026-01-21 cs.AI 57%

LeanProgress: Guiding Search for Neural Theorem Proving via Proof Progress Prediction

LeanProgress: 通过证明进度预测引导神经定理证明的搜索

Robert Joseph George, Suozhi Huang, Peiyang Song, Anima Anandkumar

机构 * Computing + Mathematical Sciences Department(计算与数学科学系) California Institute of Technology(加利福尼亚理工学院) Computer Science Department(计算机科学系) Princeton University(普林斯顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 LeanProgress通过预测证明进度提升神经定理证明效率,实现Mathlib4证明效率提升3.8%

Comments Published in TMLR (Transactions on Machine Learning Research)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13137 2026-01-19 cs.AI 57%

Theorem Prover as a Judge for Synthetic Data Generation

定理推理解释器作为合成数据生成的裁判

Joshua Ong Jun Leang, Giwon Hong, Wenda Li, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出TP-as-a-Judge和RLTPF方法,通过定理推理解释器提升LLM的合成数据生成与推理准确性。

Journal ref Proc. ACL 2025, pp. 29941-29977

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 57%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05558 2026-01-13 cs.CR cs.AI 57%

AI Agent Smart Contract Exploit Generation

AI代理智能合约漏洞生成

Arthur Gervais, Liyi Zhou

机构 * University College London(伦敦大学学院) The University of Sydney(悉尼大学) Decentralized Intelligence AG(去中心化智能有限公司) UC Berkeley RDI(伯克利大学RDI)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 A1通过代理系统结合大语言模型,实现智能合约漏洞的高效生成与验证,成功率达63%,并揭示了攻击与防御在经济上的不对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04653 2026-01-09 cs.AI cs.LO 57%

Vibe Coding an LLM-powered Theorem Prover

Vibe 编码一个基于 LLM 的定理推理论证系统

Zhe Hou

机构 * Griffith University(格里菲斯大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Isabellm是一个基于LLM的定理推理论证系统,通过结合分步推证器和证明计划器,实现自动证明合成,并展示了LLM在复杂证明任务中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03287 2026-01-08 cs.CR cs.AI 57%

Automated Post-Incident Policy Gap Analysis via Threat-Informed Evidence Mapping using Large Language Models

通过大语言模型进行威胁感知证据映射的自动事后政策差距分析

Huan Lin Oh, Jay Yong Jun Jie, Mandy Lee Ling Siu, Jonathan Pan

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行威胁感知证据映射,实现自动事后政策差距分析,提升网络安全事件审查的效率与可审计性。

Comments 5 pages, 1 figure. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02814 2026-01-07 cs.AI 57%

Causal-Enhanced AI Agents for Medical Research Screening

因果增强的医疗研究筛查AI代理

Duc Ngo, Arya Rahgoza

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种因果图增强的AI代理,用于医疗研究筛选,通过显式因果推理和双层知识图谱提升系统综述的准确性和可解释性。

Comments for submission to The 39th Canadian Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23738 2026-01-01 cs.PL cs.AI cs.FL cs.LO 57%

Enforcing Temporal Constraints for LLM Agents

为LLM代理强制执行时间约束

Adharsh Kamath, Sishen Zhang, Calvin Xu, Shubham Ugare, Gagandeep Singh, Sasa Misailovic

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) Meta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21048 2025-12-25 cs.CR cs.DC cs.LG 57%

zkFL-Health: Blockchain-Enabled Zero-Knowledge Federated Learning for Medical AI Privacy

zkFL-Health: 区块链赋能的零知识联邦学习用于医疗AI隐私

Savvy Sharma, George Petrovic, Sarthak Kaushik

机构 * School of Arts And Technology(艺术与技术学院) George Brown Polytechnic(乔治布朗理工学院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.LG

AI总结 zkFL-Health通过结合联邦学习、零知识证明和可信执行环境,实现医疗AI的隐私保护和可验证协作训练。

Comments 10 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20884 2025-12-25 cs.AI 57%

The Silent Scholar Problem: A Probabilistic Framework for Breaking Epistemic Asymmetry in LLM Agents

沉默学者问题:一种基于概率的框架,用于在LLM代理中打破知识不对称性

Zan-Kai Chong, Hiroyuki Ohsaki, Bryan Ng

机构 * School of Science and Technology(科学与技术学院) Kwansei Gakuin University(冈山大学) School of Engineering & Computer Science(工程与计算机科学学院) Victoria University of Wellington(惠灵顿维多利亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于概率的框架,用于在LLM代理中打破知识不对称性,通过双向知识交流和不确定性驱动的主动学习策略提升代理的适应性和信息获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16707 2025-12-23 cs.AI cs.LO 57%

Dual Computational Horizons: Incompleteness and Unpredictability in Intelligent Systems

双重计算 horizon:智能系统中的不完全性与不可预测性

Abhisek Ganguly

机构 * Engineering Mechanics Unit, Jawaharlal Nehru Centre for Advanced Scientific Research, Bangalore 560064, India(奈尔中心先进科学研究所工程力学单元,班加罗尔560064,印度)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了智能系统中由于形式不完全性和动态不可预测性导致的计算限制,并探讨了推理、预测与自我分析之间的权衡。

Comments 8 Pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18256 2025-12-23 cs.AI cs.LO 57%

MSC-180: A Benchmark for Automated Formal Theorem Proving from Mathematical Subject Classification

MSC-180:一个用于从数学学科分类自动形式定理证明的基准

Sirui Li, Wangyue Lu, Xiaorui Shi, Ke Weng, Haozhe Sun, Minghe Yu, Tiancheng Zhang, Ge Yu, Hengyu Liu, Lun Du

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MSC-180是一个用于评估自动形式定理证明的基准,揭示了当前基于LLM的定理证明者在数学领域覆盖和泛化能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00251 2025-12-23 cs.AI 57%

Instruction-Level Weight Shaping: A Framework for Self-Improving AI Agents

指令级权重塑造:一种自我改进的AI代理框架

Rimom Costa

机构 * Adobe Commerce Cloud Support Engineering - EMEA Division(Adobe 商业云支持工程 - EMEA部门)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 指令级权重塑造通过外部可审计伪参数提升AI代理的自我改进能力,实现低延迟部署和减少幻觉,适用于动态领域。

Comments 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17260 2025-12-22 cs.CL 57%

Seed-Prover 1.5: Mastering Undergraduate-Level Theorem Proving via Learning from Experience

Seed-Prover 1.5:通过经验学习掌握本科生级定理证明

Jiangjie Chen, Wenxiang Chen, Jiacheng Du, Jinyi Hu, Zhicheng Jiang, Allan Jie, Xiaoran Jin, Xing Jin, Chenggang Li, Wenlei Shi, Zhihong Wang, Mingxuan Wang, Chenrui Wei, Shufa Wei, Huajian Xin, Fan Yang, Weihao Gao, Zheng Yuan, Tianyang Zhan, Zeyu Zheng, Tianxi Zhou, Thomas Hanwen Zhu

机构 * ByteDance(字节跳动)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 Seed-Prover 1.5通过经验学习在形式定理证明中实现高效性能,解决大量本科生及更高难度的数学问题。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12923 2025-12-16 cs.AI cs.MA 57%

The Traitors: Deception and Trust in Multi-Agent Language Model Simulations

背叛者:多智能体语言模型模拟中的欺骗与信任

Pedro M. P. Curvo

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 The Traitors通过多智能体模拟研究LLM在社交互动中的欺骗与信任问题,揭示先进模型在欺骗能力与检测能力上的不对称性。

Comments 9 main pages, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21329 2025-12-16 cs.AI physics.soc-ph 57%

Active Inference AI Systems for Scientific Discovery

主动推断AI系统用于科学发现

Karthik Duraisamy

机构 * Michigan Institute for Computational Discovery & Engineering(密歇根计算发现与工程研究所) University of Michigan(密歇根大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出主动推断AI系统,通过结合缓慢假设生成与快速验证推理,利用因果和多模态模型促进科学发现,强调人类判断在处理不确定性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09443 2025-12-12 cs.HC cs.AI math.OC 57%

Advancing Mathematical Research via Human-AI Interactive Theorem Proving

通过人机交互定理证明推进数学研究

Chenyi Li, Zhijian Lai, Dong An, Jiang Hu, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学尤伊数学科学中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种人机交互的定理证明流程,利用大语言模型辅助数学研究,通过案例研究展示其在流形优化与Grover算法间连接的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11180 2025-12-10 cs.SE cs.AI cs.ET cs.SY eess.SY 57%

Beyond Formal Semantics for Capabilities and Skills: Model Context Protocol in Manufacturing

超越能力与技能的形式语义:制造业中的模型上下文协议

Luis Miguel Vieira da Silva, Aljosha Köcher, Felix Gehlhoff

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本文提出基于模型上下文协议(MCP)的制造业能力与技能建模方法,通过标准化接口实现与LLM的高效交互,提升工业自动化灵活性。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07038 2025-12-09 cs.CR cs.LG stat.ML 57%

Ideal Attribution and Faithful Watermarks for Language Models

语言模型中的理想归因与忠实水印

Min Jae Song, Kameron Shahabi

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究院) Paul G. Allen School of Computer Science & Engineering, University of Washington(华盛顿大学保罗·G·阿伦计算机科学与工程学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文提出了一种理想归因机制和水印方案框架,通过统一的语言和明确的保证,提升水印方案的理论基础和实际应用价值。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05836 2025-12-08 cs.AI 57%

Using Large Language Models to Create Personalized Networks From Therapy Sessions

利用大语言模型从治疗会谈中创建个性化网络

Clarissa W. Ong, Hiba Arnaout, Kate Sheehan, Estella Fox, Eugen Owtscharow, Iryna Gurevych

机构 * Department of Psychological and Brain Sciences, University of Louisville, U.S.A(心理与脑科学系,路易斯维尔大学,美国) Department of Computer Science, TU Darmstadt, Germany(计算机科学系,图恩-达姆斯塔特大学,德国) Department of Psychology, University of Toledo, U.S.A(心理学系,托莱多大学,美国)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本研究利用大语言模型从治疗记录中自动生成个性化网络,通过上下文学习和聚类方法提升临床效用和可解释性,为治疗个性化提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04374 2025-12-05 cs.CL cs.FL 57%

LangSAT: A Novel Framework Combining NLP and Reinforcement Learning for SAT Solving

LangSAT:一种结合自然语言处理和强化学习的SAT求解新框架

Muyu Pan, Matthew Walter, Dheeraj Kodakandla, Mahfuza Farooque

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 LangSAT结合自然语言处理和强化学习,通过将英语描述转换为CNF并优化求解过程,提升SAT求解的效率和普及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00214 2025-12-02 cs.CL 57%

Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis

迈向基于语料库的代理LLM用于多语言语法分析

Matej Klemen, Tjaša Arčon, Luka Terčon, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于语料库的代理LLM框架,用于多语言语法分析,通过数据驱动推理提升语法探究的可解释性和扩展性。

Comments Pre-print, submission under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21638 2025-11-27 cs.LG 57%

Aligning LLMs Toward Multi-Turn Conversational Outcomes Using Iterative PPO

通过迭代PPO对齐大语言模型以实现多轮对话结果

Daniel R. Jiang, Jalaj Bhandari, Yukai Yang, Rémi Munos, Tyler Lu

机构 * Meta FAIR at Meta(Meta的FAIR)

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

AI总结 本文提出Iterative PPO方法,通过迭代优化多轮对话中的Q函数和策略,实现更稳定的对话生成。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19423 2025-11-25 q-bio.QM cs.AI 57%

Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design

超越蛋白质语言模型:一种用于机制酶设计的代理LLM框架

Bruno Jacob, Khushbu Agarwal, Marcel Baer, Peter Rice, Simone Raugei

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Genie-CAT通过整合文献推理、结构解析、静电势计算和机器学习预测,实现蛋白质设计中可解释的科学假设生成,提升计算发现效率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13290 2025-11-24 cs.PL cs.AI 57%

Towards Formal Verification of LLM-Generated Code from Natural Language Prompts

向自然语言提示生成的LLM代码形式验证

Aaron Councilman, David Jiahao Fu, Aryan Gupta, Chengxiao Wang, David Grove, Yu-Xiong Wang, Vikram Adve

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 Astrogator通过形式查询语言和知识库实现对LLM生成代码的正确性验证,验证准确率达83%。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16588 2025-11-21 cs.AI cs.LO 57%

Formal Abductive Latent Explanations for Prototype-Based Networks

基于原型网络的正式归纳性隐式解释

Jules Soria, Zakaria Chihani, Julien Girard-Satabin, Alban Grastien, Romain Xu-Darme, Daniela Cancila

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于原型网络的正式归纳性隐式解释方法,通过形式化方法提升模型可解释性,适用于图像分类任务。

Comments Accepted at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14435 2025-11-19 cs.SE cs.AI cs.LO 57%

Watchdogs and Oracles: Runtime Verification Meets Large Language Models for Autonomous Systems

Angelo Ferrando

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments In Proceedings FMAS 2025, arXiv:2511.13245

Journal ref EPTCS 436, 2025, pp. 80-87

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13293 2025-11-18 cs.AI 57%

Grounded by Experience: Generative Healthcare Prediction Augmented with Hierarchical Agentic Retrieval

Chuang Zhao, Hui Tang, Hongke Zhao, Xiaofang Zhou, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学) College of Management and Economics, Laboratory of Computation and Analytics of Complex Management Systems (CACMS), Tianjin University(管理学院与经济学学院,复杂管理系统的计算与分析实验室,天津大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科技大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10356 2025-11-14 cs.AI 57%

SITA: A Framework for Structure-to-Instance Theorem Autoformalization

Chenyi Li, Wanli Ma, Zichen Wang, Zaiwen Wen

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏