arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2602.22442 2026-03-17 cs.AI 57%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02990 2026-03-17 cs.LG 57%

Learning to Repair Lean Proofs from Compiler Feedback

从编译器反馈中学习修复Lean证明

Evan Wang, Simon Chess, Daniel Lee, Siyuan Ge, Ajit Mallavarapu, Jarod Alper, Vasily Ilin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了将Lean证明修复作为监督学习问题,提出APRIL数据集,通过系统生成的证明错误与编译器诊断配对,提升修复准确性和反馈条件推理能力。

Comments 15 pages, 6 figures

Journal ref ICLR VerifAI Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06737 2026-03-10 cs.LO cs.AI cs.SC 57%

Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents

Agent Hunt: 基于奖金的协作自动形式化与LLM代理

Chad E. Brown, Cezary Kaliszyk, Josef Urban

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 基于奖金的协作自动形式化方法,利用LLM代理在交互式定理证明环境中进行去中心化证明搜索与理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21648 2026-03-05 cs.AI 57%

Leveraging Imperfection with MEDLEY A Multi-Model Approach Harnessing Bias in Medical AI

利用不完美性:MEDLEY:一种多模型方法,利用医学AI中的偏差

Farhad Abtahi, Mehdi Astaraki, Fernando Seoane

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MEDLEY提出了一种多模型框架,通过保留模型多样性而非压缩共识,利用医学AI中的偏差提升诊断准确性与透明度。

Journal ref Front. Artif. Intell., Volume 9 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01407 2026-03-03 cs.AI cs.MA cs.SI 57%

The Observer-Situation Lattice: A Unified Formal Basis for Perspective-Aware Cognition

观察者-情境格:一种面向视角感知认知的统一基础

Saad Alqithami

机构 * Computer Science Department, Al-Baha University(阿尔巴大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出观察者-情境格(OSL),一种统一的数学结构,用于支持面向视角的认知推理,通过两个关键算法实现信念管理和矛盾分解,提升多智能体环境中的推理效率和鲁棒性。

Comments Extended version of the AAMAS 2026 paper with the same title

Journal ref 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026, IFAAMAS, 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01170 2026-03-03 cs.CR cs.AI 57%

ATLAS: AI-Assisted Threat-to-Assertion Learning for System-on-Chip Security Verification

ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证

Ishraq Tashdid, Kimia Tasnia, Alexander Garcia, Jonathan Valamehr, Sazadur Rahman

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Intel Corporation(英特尔公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 57%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23720 2026-03-02 cs.AI 57%

The Auton Agentic AI Framework

自主AI框架

Sheng Cao, Zhao Chang, Chang Li, Hannan Li, Liyao Fu, Ji Tang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Auton框架通过分离认知蓝图与运行时引擎,实现自主代理系统的标准化创建、执行和治理,采用增强POMDP模型和三级自我进化框架提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00060 2026-03-02 cs.CV cs.AI cs.RO 57%

Less is More: Lean yet Powerful Vision-Language Model for Autonomous Driving

少即是多:一种高效而强大的视觉-语言模型用于自动驾驶

Sheng Yang, Tong Zhan, Guancheng Chen, Yanfeng Lu, Jian Wang

机构 * School of Data Science, Fudan University Shanghai, China(复旦大学数据科学学院) Institute of Automation, Chinese Academy of Sciences Beijing, China(中国科学院自动化研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本研究提出Max-V1模型,通过端到端视觉-语言方法实现高效自动驾驶,取得nuScenes数据集上的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20624 2026-02-25 cs.AI cond-mat.stat-mech 57%

Physics-based phenomenological characterization of cross-modal bias in multimodal models

基于物理现象的多模态模型跨模态偏差表征

Hyeongmo Kim, Sohyun Kang, Yerin Choi, Seungyeon Ji, Junhyuk Woo, Hyunsuk Chung, Soyeon Caren Han, Kyungreem Han

机构 * B rain Science Institute(脑科学研究院) Korea Institute of Science and Technology(韩国科学技术院) Department of Physics and Astronomy(物理与天文学系) Department of Computer Science and Engineering(计算机科学与工程系) University of Science and Technology KIST School(科学技术KIST学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的多模态模型跨模态偏差表征方法,揭示多模态输入可能强化模态主导性。

Comments Best Paper Award at BiasinAI track in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11963 2026-02-25 cs.CR cs.AI 57%

MARVEL: Multi-Agent RTL Vulnerability Extraction using Large Language Models

MARVEL:基于大语言模型的多智能体RTL漏洞提取

Luca Collini, Baleegh Ahmad, Joey Ah-kiow, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MARVEL通过多智能体框架利用大语言模型,高效识别RTL代码中的安全漏洞,发现有效漏洞和警告,提升硬件安全验证效率。

Comments Submitted for Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19065 2026-02-24 cs.AI 57%

Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents

代理问题框架:一种系统化的方法用于工程可靠领域代理

Chanjin Park

机构 * Institute of Engineering Research(工程研究所) Seoul National University(首尔国立大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出代理问题框架(APF),通过系统化工程方法提升领域代理的可靠性,结合AJD规范工具和AVR循环实现任务要求的渐近收敛。

Comments 18 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16873 2026-02-20 cs.MA cs.AI 57%

AdaptOrch: Task-Adaptive Multi-Agent Orchestration in the Era of LLM Performance Convergence

AdaptOrch:在LLM性能收敛时代的任务自适应多智能体协调

Geunbin Yu

机构 * Department of Artificial Intelligence, Korea National Open University(人工智能系,韩国国立开放大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 AdaptOrch通过动态选择多智能体协调拓扑,提升任务性能,证明协调设计优于模型选择。

Comments 21 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13587 2026-02-17 cs.AI cs.MA 57%

A First Proof Sprint

首次证明冲刺

Joseph Corneli

机构 * Hyperreal Enterprises Ltd(超现实企业有限公司)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 本文通过多智能体证明冲刺方法,解决十个研究级问题,采用结构意识验证和层切换策略提高证明可靠性与校准。

Comments 144 pages, 7 color images. Submission to First Proof February 2026 (arxiv:2602.05192, https://1stproof.org/), uploaded 20:07 Friday, 13 February 2026 Pacific Time (PT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI 57%

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12630 2026-02-16 cs.CR cs.AI 57%

TensorCommitments: A Lightweight Verifiable Inference for Language Models

张量承诺:一种轻量级可验证的语言模型推断

Oguzhan Baser, Elahe Sadeghi, Eric Wang, David Ribeiro Alves, Sam Kazemian, Hong Kang, Sandeep P. Chinchali, Sriram Vishwanath

机构 * The University of Texas at Austin(德克萨斯大学) Georgia Institute of Technology(佐治亚理工学院) Theseus AI Labs(Theseus AI实验室) McGill University(麦吉尔大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 张量承诺通过轻量级的证明方案实现可验证的语言模型推断,提高对抗性攻击的鲁棒性。

Comments 23 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06111 2026-02-13 cs.AI 57%

SKATE, a Scalable Tournament Eval: Weaker LLMs differentiate between stronger ones using verifiable challenges

SKATE,一种可扩展的锦标赛评估:较弱的LLM通过可验证的挑战区分更强的LLM

Dewi S. W. Gould, Bruno Mlodozeniec, Samuel F. Brown

机构 * The Alan Turing Institute(阿尔文·图灵研究所) University of Cambridge(剑桥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Independent(独立研究者)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 SKATE通过让LLM相互生成和解决可验证任务,实现可扩展的评估框架,揭示模型间的细微能力差异。

Comments 7 pages and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10481 2026-02-12 cs.CR cs.AI cs.MA 57%

Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI

保护上下文和提示:非确定性AI的确定性安全

Mohan Rajagopalan, Vinay Rao

机构 * MACAW Security, Inc.(MACAW安全公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09112 2026-02-11 cs.AI 57%

A Small-Scale System for Autoregressive Program Synthesis Enabling Controlled Experimentation

一个小型系统用于自回归程序合成,以实现受控实验

Russ Webb, Jason Ramapuram

机构 * Apple(苹果公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 Cadmus系统通过低成本模型实现复杂程序合成任务,展示其在整数算术任务中的优越性能并揭示大模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17332 2026-02-11 cs.AI cs.MA 57%

Agentifying Agentic AI

使AI具备代理性

Virginia Dignum, Frank Dignum

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过整合BDI架构与制度建模,构建具备透明性和合作性的代理系统,实现自主性与责任感的统一。

Comments 10 pages; 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10216 2026-02-09 cs.PL cs.AI cs.SE 57%

Learning to Guarantee Type Correctness in Code Generation through Type-Guided Program Synthesis

通过类型引导的程序合成学习保证类型正确性

Zhechong Huang, Zhao Zhang, Ruyi Ji, Tingxuan Xia, Qihao Zhu, Qinxiang Cao, Zeyu Sun, Wiggin Zhou, Yingfei Xiong

机构 * Peking University(北京大学) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Tencent(腾讯)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 TyFlow 通过内部化类型推理,提升代码生成的类型正确性与功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05059 2026-02-06 cs.AI 57%

Evaluating Large Language Models on Solved and Unsolved Problems in Graph Theory: Implications for Computing Education

在图论中解决和未解决的问题上评估大语言模型:对计算教育的启示

Adithya Kulkarni, Mohna Chakraborty, Jay Bagga

机构 * Department of Computer Science(计算机科学系) Ball State University(巴尔的摩州立大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) Jio Institute(乔研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在图论已解决和未解决问题上的表现,发现其在已有知识探索上有效,但在需要创新数学洞察的任务中存在局限,对计算教育有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00638 2026-02-03 cs.CL 57%

Formal Semantic Control over Language Models

语言模型的正式语义控制

Yingji Zhang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过VAE框架,探索了在潜在空间中解构语义特征以提升语言模型的可解释性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20090 2026-01-30 cs.AI 57%

Should I Have Expressed a Different Intent? Counterfactual Generation for LLM-Based Autonomous Control

我本应表达不同的意图?基于LLM的自主控制的反事实生成

Amirmohammad Farzaneh, Salvatore D'Oro, Osvaldo Simeone

机构 * Department of Engineering, King's College London, London, UK(伦敦大学金史密斯学院工程系) Intelligent Networked Systems Institute (INSI), Northeastern University, Boston, MA, USA(东北大学智能网络系统研究所) Intelligent Networked Systems Institute (INSI), Northeastern University, London, UK(伦敦大学东北大学智能网络系统研究所)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于结构因果模型的反事实生成方法,通过概率性反事实生成和离线校准,为LLM驱动的自主控制提供可靠反事实推理,展示了在无线网络控制中的显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18944 2026-01-29 cs.AI cs.PL cs.SE 57%

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

为验证条件进行神经定理证明:一个现实世界的基准测试

Qiyuan Xu, Xiaokun Luan, Renxi Wang, Joshua Ong Jun Leang, Peixin Wang, Haonan Li, Wenda Li, Conrad Watt

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) MBZUAI Imperial College London(帝国理工学院) East China Normal University(华东师范大学) University of Edinburgh(爱丁堡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出NTP4VC,首个现实世界多语言基准测试,评估LLMs在自动验证条件证明中的表现,揭示程序验证中的挑战与未来研究方向。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19605 2026-01-28 cs.CL 57%

Decompose-and-Formalise: Recursively Verifiable Natural Language Inference

分解与形式化:可递归验证的自然语言推理

Xin Quan, Marco Valentino, Louise A. Dennis, André Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 本文提出分解与形式化框架,通过自底向上的验证和局部诊断引导细化,提升自然语言推理的解释验证效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26201 2026-01-28 cs.AI cond-mat.mes-hall cond-mat.mtrl-sci 57%

LLM Agents for Knowledge Discovery in Atomic Layer Processing

用于原子层处理中知识发现的LLM代理

Andreas Werbrouck, Marshall B. Lindsay, Matthew Maschmann, Matthias J. Young

机构 * University of Missouri Columbia(密苏里大学哥伦比亚分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用LLM代理在原子层处理中探索化学相互作用,通过试错和持续探索实现知识发现。

Comments Accepted submission to the AI4MAT workshop@NEURIPS 2025. As submitted, except author names added

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20082 2026-01-27 cs.AI cs.CY 57%

Evolution of AI in Education: Agentic Workflows

人工智能在教育中的演变:代理工作流

Firuz Kamalov, David Santandreu Calonge, Linda Smail, Dilshod Azizov, Dimple R. Thadani, Theresa Kwong, Amara Atif

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了AI代理在教育中的应用,提出多代理框架用于自动评分,并指出其在一致性上的优势及需进一步研究的可解释性问题。

Comments made the abstract more succinct, revised the methodology, added PRISMA flow chart, updated references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10758 2026-01-22 cs.CY cs.AI 57%

Designing AI-Resilient Assessments Using Interconnected Problems: A Theoretically Grounded and Empirically Validated Framework

利用互联问题设计AI鲁棒评估:一种理论严谨且经验证实的框架

Kaihua Ding

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种理论严谨且经验证实的框架,通过设计互联问题来提高评估的AI鲁棒性,挑战了开放性评估的鲁棒性假设,并提供了实证支持和实用设计方法。

Comments 8 pages, 3 figures and 3 tables, under submission to IEEE FIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12444 2026-01-21 cs.AI cs.LO 57%

Large Language Model for OWL Proofs

面向OWL证明的大型语言模型

Hui Yang, Jiaoyan Chen, Uli Sattler

机构 * The University of Manchester(曼彻斯特大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出面向OWL本体论证明生成的LLM方法,通过构建评估框架验证了逻辑复杂性对LLM性能的影响,并发现输入数据质量对证明生成至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏