arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2606.19315 2026-06-18 cs.LG 新提交 70%

Diffusion-Proof: Recipe for Formal Theorem Proving Beyond Auto-Regressive Generation

Diffusion-Proof:超越自回归生成的正式定理证明配方

Ruida Wang, Rui Pan, Pengcheng Wang, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

专题命中 代码与定理证明 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 提出Diffusion-Proof框架,首次将扩散语言模型应用于形式定理证明,通过全证明生成和局部校正方法,在ProofNet和MiniF2F上分别提升1.61%和6.14%,并解决了一个DeepSeek-Prover-V2-7B无法解决的IMO问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14357 2026-06-15 cs.SE cs.AI 新提交 70%

No Accidental Software Agent First Canonical Code for Human Code Entropy Reduction and 30 to 500 times Lower Frontier Model Requirements

无意外软件智能体:首个用于人类代码熵降低的正则代码,以及30到500倍的前沿模型需求降低

Jepson Taylor

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出智能体优先的正则代码方法,通过行为等价商化人类代码中的意外熵,实现30-500倍的前沿模型需求降低,核心是行为等价商化和证明携带变更。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02249 2026-06-12 cs.AI 版本更新 70%

A Study of Belief Revision Postulates in Multi-Agent Systems (Extended Version)

多智能体系统中信念修正公设的研究(扩展版)

Michael Thielscher, Tran Cao Son

机构 * University of New South Wales(新南威尔士大学) New Mexico State University(新墨西哥州立大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究认知规划中的信念修正问题,将经典AGM信念修正公设推广到多智能体环境,提出广义全交多智能体信念修正算子,并讨论迭代修正公设的推广及事件模型修正算子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11389 2026-05-29 cs.AI 70%

Causal-JEPA: Learning World Models through Object-Level Latent Masking

Causal-JEPA:通过对象级潜在掩码学习世界模型

Heejeong Nam, Quentin Le Lidec, Lucas Maes, Yann LeCun, Randall Balestriero

机构 * Brown University, GalilAI(布朗大学,GalilAI) New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出C-JEPA,一种通过对象级潜在掩码扩展联合嵌入预测的对象中心世界模型,在视觉问答和智能体控制任务中分别提升反事实推理20%和仅用1%潜在特征实现高效规划。

Comments Project Page: https://hazel-heejeong-nam.github.io/cjepa/ ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12955 2026-05-28 cs.AI 70%

Text2Model: Modeling Copilots for Text-to-Model Translation

Text2Model: 用于文本到模型翻译的建模副驾驶

Serdar Kadioglu, Karthik Uppuluri, Akash Singirikonda

机构 * AI Center of Excellence, Fidelity Investments(富达投资人工智能卓越中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Text2Model和Text2Zinc,通过统一架构和数据集、求解器无关的方式,利用多种LLM策略实现文本到组合优化与满足问题的模型翻译,并开源副驾驶和排行榜以缩小性能差距。

Comments AAAI'25 Bridge Program on Machine Learning and Operations Research CPAIOR'26 Master Class on LLMs for CP/OR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25181 2026-05-26 cs.AI 70%

SpecAlign: A Semantic Alignment Framework for SystemVerilog Assertion Generation

SpecAlign: 一种用于 SystemVerilog 断言生成的语义对齐框架

Jaime Rafael Imperial, Hao Zheng

机构 * University of South Florida(佛罗里达州立大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出 SpecAlign 框架,通过基于蕴含的分类和自一致性投票机制,评估并改进 LLM 生成的 SVA 与自然语言规范之间的语义对齐,无需黄金 RTL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23931 2026-05-26 cs.AI cs.PL cs.SE 70%

BODHI: Precise OS Kernel Specification Inference

BODHI:精确的操作系统内核规范推断

Zhiming Chang, Ziyang Li

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Johns Hopkins University(约翰霍普金斯大学) Department of Computer Science(计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出一种领域知识提示方法BODHI,通过结构化C到Python翻译指南增强少样本提示,在OSV-Bench基准上将Pass@1从55.10%提升至96.73%,缩小了通用代码生成与形式规范合成之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27132 2026-05-01 cs.AI 70%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20523 2026-04-23 cs.SE cs.AI 70%

Early-Stage Product Line Validation Using LLMs: A Study on Semi-Formal Blueprint Analysis

利用LLM进行早期阶段产品线验证:对半正式蓝图分析的研究

Viet-Man Le, Thi Ngoc Trang Tran, Sebastian Lubos, Alexander Felfernig, Damian Garber

机构 * Graz University of Technology(格拉茨技术大学)

专题命中 代码与定理证明 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 研究LLM能否直接对半正式文本蓝图执行特征模型分析操作,通过12种先进LLM和16种标准操作,对比其与求解器FLAMA的输出,发现优化推理模型在准确性上接近求解器,揭示了结构解析和约束推理的系统性错误及精度-成本权衡。

Comments The 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), March 23--27, 2026, Thessaloniki, Greece DOI: 10.1145/3748522.3779903

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18203 2026-04-15 cs.CL cs.CY 70%

How Psychological Learning Paradigms Shaped and Constrained Artificial Intelligence

心理学习范式如何塑造和制约人工智能

Alex Anvi Eponon, Ildar Batyrshin, Christian E. Maldonado-Sifuentes, Grigori Sidorov

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。

Comments preprint journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10087 2026-04-14 cs.AI 70%

Ontological Trajectory Forecasting via Finite Semigroup Iteration and Lie Algebra Approximation in Geopolitical Knowledge Graphs

通过有限半群迭代和李代数近似进行本体轨迹预测:在地缘政治知识图谱中的应用

Qihang Wu

机构 * Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业及系统工程学系)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出EL-DRUIN系统,结合形式本体、有限半群代数和李代数近似,预测地缘政治长期关系轨迹,通过半群操作和李代数空间向量嵌入实现可解释的概率预测。

Comments 18 pages. Code and system available at https://github.com/wuqihang-brave/El-druin

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00280 2026-04-02 cs.SE cs.AI 70%

VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications

VeriAct:超越可验证性——基于代理的正确且完整的正式规范合成

Md Rakib Hossain Misu, Iris Ma, Cristina V. Lopes

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 代码与定理证明 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出VeriAct框架,通过迭代合成与修复规范,超越传统方法的性能极限,生成正确且完整的正式规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 70%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16975 2026-03-19 cs.SE cs.AI cs.CY cs.ET cs.HC 70%

The State of Generative AI in Software Development: Insights from Literature and a Developer Survey

生成式人工智能在软件开发中的现状:文献和开发者调查的洞察

Vincent Gurgul, Robin Gubela, Stefan Lessmann

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过文献综述和65名开发者的调查,发现生成式AI在设计、实现、测试和文档中影响最大,显著减少重复性任务时间,但早期SDLC阶段收益较低,需加强治理以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 70%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12170 2026-02-13 cs.AI 70%

Statistical Parsing for Logical Information Retrieval

逻辑信息检索的统计解析

Greg Coppola

机构 * Greg Coppola, PhD(格雷格·科波拉,博士)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种结合LLM和QBBN的逻辑信息检索方法,通过扩展QBBN实现反向推理,构建类型逻辑语言和确定性语法解析器,以提升自然语言处理的结构化解析能力。

Comments 23 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06795 2026-01-23 cs.AI 70%

GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning

GDEPO:基于增强训练数据利用的群体双动态和等权优势策略优化

Zhengqing Yan, Xinyang Liu, Yi Zhang, Fan Guo, ChengXun Jia, Junchen Wan, Yao Liu, Qi Liu, Jihao Huang, Kang Song

机构 * State Key Laboratory of Engines, Tianjin University(发动机国家重点实验室,天津大学) Artificial Intelligence Center, Cylingo Group(Cylingo集团人工智能中心)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 GDEPO通过动态补充采样、等权优势和动态补充迭代机制,提升ATP中强化学习的数据利用效率和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09771 2026-01-16 cs.AI 70%

PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation

PCN-Rec: 基于代理的证明携带协商用于可靠约束下的推荐

Aradhya Dixit, Shreem Dixit

机构 * Wake Technical Community College(韦克技术社区学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 PCN-Rec通过代理证明携带协商机制,在满足治理约束的同时提升推荐可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07420 2025-12-19 math.HO cs.AI cs.HC math.GR math.LO 70%

Advancing mathematics research with generative AI

用生成式人工智能推动数学研究

Lisa Carbone

机构 * Department of Mathematics, Rutgers University(数学系,罗格斯大学)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文探讨了生成式人工智能在数学研究中的应用,包括其作为交互式助手的功能以及与神经符号求解器等工具的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11827 2025-12-17 cs.CY cs.AI cs.CV 70%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09810 2025-12-16 cs.AI 70%

Towards a Common Framework for Autoformalization

迈向自动形式化的一个共同框架

Agnieszka Mensfelt, David Tena Cucala, Santiago Franco, Angeliki Koutsoukou-Argyraki, Vince Trencsenyi, Kostas Stathis

机构 * Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文旨在提出一个统一框架,以促进不同领域之间的交叉融合,推动下一代人工智能系统的发展。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575). A shorter version of this work will appear in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13043 2025-12-02 cs.CL 70%

Spark-Prover-X1: Formal Theorem Proving Through Diverse Data Training

Spark-Prover-X1:通过多样化数据训练实现形式定理证明

Xinyuan Zhou, Yi Lei, Xiaoyu Zhou, Jingyi Sun, Yu Zhu, Zhongyi Ye, Weitai Zhang, Quan Liu, Si Wei, Cong Liu

机构 * iFlytek Research(iFlytek研究院)

专题命中 代码与定理证明 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 Spark-Prover-X1通过多样化数据训练提升轻量级LLMs的形式推理能力,实现形式定理证明的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09721 2025-10-24 cs.SE cs.CL 70%

A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System

Jiale Guo, Suizhi Huang, Mei Li, Dong Huang, Xingsheng Chen, Regina Zhang, Zhijiang Guo, Han Yu, Siu-Ming Yiu, Pietro Lio, Kwok-Yan Lam

机构 * Digital Trust Centre, Nanyang Technological University, Singapore(南洋理工大学数字信任中心) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) The Hong Kong University of Science and Technology, Hong Kong(香港科学与技术大学) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) School of Computing and Data Science, The University of Hong Kong, Hong Kong(香港大学计算与数据科学学院) School of Computer Science and Technology, The University of Cambridge, UK(剑桥大学计算机科学与技术学院)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11647 2025-08-19 cs.LO cs.AI 70%

Categorical Construction of Logically Verifiable Neural Architectures

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17257 2025-07-24 cs.AI cs.MA 70%

Agent Identity Evals: Measuring Agentic Identity

Elija Perrier, Michael Timothy Bennett

机构 * Centre for Quantum Software & Information(量子软件与信息中心) University of Technology, Sydney(悉尼技术大学) Australian National University(澳大利亚国立大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23080 2025-07-11 cs.AI 70%

AI's Euclid's Elements Moment: From Language Models to Computable Thought

Xinmin Fang, Lingfeng Tao, Zhengxiong Li

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Colorado Denver (CU Denver)(科罗拉多大学丹佛分校) Department of Robotics and Mechatronics(机器人与机电学系) Kennesaw State University (KSU)(凯斯维尔州立大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22068 2025-06-30 cs.AI 70%

Query as Test: An Intelligent Driving Test and Data Storage Method for Integrated Cockpit-Vehicle-Road Scenarios

Shengyue Yao, Runqing Guo, Yangyang Qin, Miangbing Meng, Jipeng Cao, Yilun Lin, Yisheng Lv, Fei-Yue Wang

机构 * Peking University International Innovation Center, Lin-gang Special Area (PKU-IICSH)(北京大学国际创新中心,临港特殊区域(PKU-IICSH)) Onesyn (Shanghai) Technology Co., Ltd(上海奥森科技有限公司) CATARC Automotive Technology(Shanghai) Co.,Ltd(CATARC汽车技术(上海)有限公司) ZEEKR Intelligent Technology Holding Limited(ZEKR智能技术控股有限公司) Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科技大学)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Comments Submitted to IEEE Transaction on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11140 2025-06-23 cs.CV cs.AI cs.MA 70%

Autonomous Computer Vision Development with Agentic AI

Jin Kim, Muhammad Wahi-Anwa, Sangyun Park, Shawn Shin, John M. Hoffman, Matthew S. Brown

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments The paper is 13 pages long and contains 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02355 2025-06-23 cs.LG 70%

Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening

Andre He, Daniel Fried, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03524 2025-06-06 cs.CL cs.SE 70%

Seed-Coder: Let the Code Model Curate Data for Itself

ByteDance Seed, Yuyu Zhang, Jing Su, Yifan Sun, Chenguang Xi, Xia Xiao, Shen Zheng, Anxiang Zhang, Kaibo Liu, Daoguang Zan, Tao Sun, Jinhua Zhu, Shulin Xin, Dong Huang, Yetao Bai, Lixin Dong, Chao Li, Jianchong Chen, Hanzhi Zhou, Yifan Huang, Guanghan Ning, Xierui Song, Jiaze Chen, Siyao Liu, Kai Shen, Liang Xiang, Yonghui Wu

机构 * ByteDance Seed(字节跳动种子)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏