arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2603.16975 2026-03-19 cs.SE cs.AI cs.CY cs.ET cs.HC 70%

The State of Generative AI in Software Development: Insights from Literature and a Developer Survey

生成式人工智能在软件开发中的现状:文献和开发者调查的洞察

Vincent Gurgul, Robin Gubela, Stefan Lessmann

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过文献综述和65名开发者的调查,发现生成式AI在设计、实现、测试和文档中影响最大,显著减少重复性任务时间,但早期SDLC阶段收益较低,需加强治理以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 70%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 代码与定理证明 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12170 2026-02-13 cs.AI 70%

Statistical Parsing for Logical Information Retrieval

逻辑信息检索的统计解析

Greg Coppola

机构 * Greg Coppola, PhD(格雷格·科波拉,博士)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出了一种结合LLM和QBBN的逻辑信息检索方法,通过扩展QBBN实现反向推理,构建类型逻辑语言和确定性语法解析器,以提升自然语言处理的结构化解析能力。

Comments 23 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06795 2026-01-23 cs.AI 70%

GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning

GDEPO:基于增强训练数据利用的群体双动态和等权优势策略优化

Zhengqing Yan, Xinyang Liu, Yi Zhang, Fan Guo, ChengXun Jia, Junchen Wan, Yao Liu, Qi Liu, Jihao Huang, Kang Song

机构 * State Key Laboratory of Engines, Tianjin University(发动机国家重点实验室,天津大学) Artificial Intelligence Center, Cylingo Group(Cylingo集团人工智能中心)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 GDEPO通过动态补充采样、等权优势和动态补充迭代机制,提升ATP中强化学习的数据利用效率和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09771 2026-01-16 cs.AI 70%

PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation

PCN-Rec: 基于代理的证明携带协商用于可靠约束下的推荐

Aradhya Dixit, Shreem Dixit

机构 * Wake Technical Community College(韦克技术社区学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 PCN-Rec通过代理证明携带协商机制,在满足治理约束的同时提升推荐可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07420 2025-12-19 math.HO cs.AI cs.HC math.GR math.LO 70%

Advancing mathematics research with generative AI

用生成式人工智能推动数学研究

Lisa Carbone

机构 * Department of Mathematics, Rutgers University(数学系,罗格斯大学)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文探讨了生成式人工智能在数学研究中的应用,包括其作为交互式助手的功能以及与神经符号求解器等工具的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11827 2025-12-17 cs.CY cs.AI cs.CV 70%

Assessing Greenspace Attractiveness with ChatGPT, Claude, and Gemini: Do AI Models Reflect Human Perceptions?

利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?

Milad Malekzadeh, Magdalena Biernacka, Elias Willberg, Jussi Torkko, Edyta Łaszkiewicz, Tuuli Toivonen

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09810 2025-12-16 cs.AI 70%

Towards a Common Framework for Autoformalization

迈向自动形式化的一个共同框架

Agnieszka Mensfelt, David Tena Cucala, Santiago Franco, Angeliki Koutsoukou-Argyraki, Vince Trencsenyi, Kostas Stathis

机构 * Department of Computer Science, Royal Holloway, University of London(伦敦大学皇家霍洛威学院计算机科学系) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文旨在提出一个统一框架,以促进不同领域之间的交叉融合,推动下一代人工智能系统的发展。

Comments Presented at NeLaMKRR@KR, 2025 (arXiv:2511.09575). A shorter version of this work will appear in the Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13043 2025-12-02 cs.CL 70%

Spark-Prover-X1: Formal Theorem Proving Through Diverse Data Training

Spark-Prover-X1:通过多样化数据训练实现形式定理证明

Xinyuan Zhou, Yi Lei, Xiaoyu Zhou, Jingyi Sun, Yu Zhu, Zhongyi Ye, Weitai Zhang, Quan Liu, Si Wei, Cong Liu

机构 * iFlytek Research(iFlytek研究院)

专题命中 代码与定理证明 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 Spark-Prover-X1通过多样化数据训练提升轻量级LLMs的形式推理能力,实现形式定理证明的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09721 2025-10-24 cs.SE cs.CL 70%

A Comprehensive Survey on Benchmarks and Solutions in Software Engineering of LLM-Empowered Agentic System

Jiale Guo, Suizhi Huang, Mei Li, Dong Huang, Xingsheng Chen, Regina Zhang, Zhijiang Guo, Han Yu, Siu-Ming Yiu, Pietro Lio, Kwok-Yan Lam

机构 * Digital Trust Centre, Nanyang Technological University, Singapore(南洋理工大学数字信任中心) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) The Hong Kong University of Science and Technology, Hong Kong(香港科学与技术大学) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) School of Computing and Data Science, The University of Hong Kong, Hong Kong(香港大学计算与数据科学学院) School of Computer Science and Technology, The University of Cambridge, UK(剑桥大学计算机科学与技术学院)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11647 2025-08-19 cs.LO cs.AI 70%

Categorical Construction of Logically Verifiable Neural Architectures

Logan Nye

机构 * Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17257 2025-07-24 cs.AI cs.MA 70%

Agent Identity Evals: Measuring Agentic Identity

Elija Perrier, Michael Timothy Bennett

机构 * Centre for Quantum Software & Information(量子软件与信息中心) University of Technology, Sydney(悉尼技术大学) Australian National University(澳大利亚国立大学)

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23080 2025-07-11 cs.AI 70%

AI's Euclid's Elements Moment: From Language Models to Computable Thought

Xinmin Fang, Lingfeng Tao, Zhengxiong Li

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of Colorado Denver (CU Denver)(科罗拉多大学丹佛分校) Department of Robotics and Mechatronics(机器人与机电学系) Kennesaw State University (KSU)(凯斯维尔州立大学)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22068 2025-06-30 cs.AI 70%

Query as Test: An Intelligent Driving Test and Data Storage Method for Integrated Cockpit-Vehicle-Road Scenarios

Shengyue Yao, Runqing Guo, Yangyang Qin, Miangbing Meng, Jipeng Cao, Yilun Lin, Yisheng Lv, Fei-Yue Wang

机构 * Peking University International Innovation Center, Lin-gang Special Area (PKU-IICSH)(北京大学国际创新中心,临港特殊区域(PKU-IICSH)) Onesyn (Shanghai) Technology Co., Ltd(上海奥森科技有限公司) CATARC Automotive Technology(Shanghai) Co.,Ltd(CATARC汽车技术(上海)有限公司) ZEEKR Intelligent Technology Holding Limited(ZEKR智能技术控股有限公司) Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory for Management and Control of Complex Systems, Chinese Academy of Sciences(复杂系统管理与控制国家重点实验室,中国科学院) Macao Institute of Systems Engineering, Macau University of Science and Technology(澳门系统工程研究院,澳门科技大学)

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Comments Submitted to IEEE Transaction on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11140 2025-06-23 cs.CV cs.AI cs.MA 70%

Autonomous Computer Vision Development with Agentic AI

Jin Kim, Muhammad Wahi-Anwa, Sangyun Park, Shawn Shin, John M. Hoffman, Matthew S. Brown

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments The paper is 13 pages long and contains 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02355 2025-06-23 cs.LG 70%

Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening

Andre He, Daniel Fried, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03524 2025-06-06 cs.CL cs.SE 70%

Seed-Coder: Let the Code Model Curate Data for Itself

ByteDance Seed, Yuyu Zhang, Jing Su, Yifan Sun, Chenguang Xi, Xia Xiao, Shen Zheng, Anxiang Zhang, Kaibo Liu, Daoguang Zan, Tao Sun, Jinhua Zhu, Shulin Xin, Dong Huang, Yetao Bai, Lixin Dong, Chao Li, Jianchong Chen, Hanzhi Zhou, Yifan Huang, Guanghan Ning, Xierui Song, Jiaze Chen, Siyao Liu, Kai Shen, Liang Xiang, Yonghui Wu

机构 * ByteDance Seed(字节跳动种子)

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03094 2024-12-25 cs.AI 70%

A Divide-Align-Conquer Strategy for Program Synthesis

Jonas Witt, Sebastijan Dumančić, Tias Guns, Claus-Christian Carbon

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01829 2024-11-05 cs.LG 70%

Formal Theorem Proving by Rewarding LLMs to Decompose Proofs Hierarchically

Kefan Dong, Arvind Mahankali, Tengyu Ma

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.11456 2024-10-30 cs.AI cs.CY cs.MA 70%

Norms, Institutions, and Robots

Stevan Tomic, Federico Pecora, Alessandro Saffiotti

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 12 pages, 8 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06557 2024-02-12 cs.AI cs.IR 70%

The Quantified Boolean Bayesian Network: Theory and Experiments with a Logical Graphical Model

Gregory Coppola

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.13710 2022-09-29 cs.AI 70%

Towards Human-Compatible XAI: Explaining Data Differentials with Concept Induction over Background Knowledge

Cara Widmer, Md Kamruzzaman Sarker, Srikanth Nadella, Joshua Fiechter, Ion Juvina, Brandon Minnery, Pascal Hitzler, Joshua Schwartz, Michael Raymer

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.02127 2021-07-06 cs.AI 70%

Addendum to "HTN Acting: A Formalism and an Algorithm"

Lavindra de Silva

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments This paper is a more detailed version of the following publication: Lavindra de Silva, "HTN Acting: A Formalism and an Algorithm", in Proceedings of AAMAS 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.14915 2021-06-01 cs.AI cs.HC 70%

SMASH: a Semantic-enabled Multi-agent Approach for Self-adaptation of Human-centered IoT

Hamed Rahimi, Iago Felipe Trentin, Fano Ramparany, Olivier Boissier

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Submitted to PAAMS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13567 2026-08-17 cs.AI cs.CL cs.LG 新提交 67%

Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中出现的模块化认知架构

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。

Comments https://pengrui-han.github.io/LLM_Modularity_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23806 2026-07-28 cs.CL cs.AI cs.IR cs.LG cs.PF 新提交 67%

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此

Sietse Schelpe

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。

Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18575 2026-07-22 cs.CR 新提交 67%

RECEIPT: Deterministic, Reward-Hacking-Resistant Verification for White-Box Agentic XSS Discovery

RECEIPT:用于白盒代理式XSS发现的确定性、抗奖励攻击验证

Muxi Lyu, Karen Shieh, Yiwei Hou, Hao Wang, Koushik Sen, David Wagner

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract)

AI总结 研究针对白盒代理式XSS发现中编码代理声明不可信的问题,提出RECEIPT验证框架,通过环境隔离等手段使发现可信,经实验评估,在预算内发现多个未知漏洞,相比其他方式能确认更多真实利用且无假阳性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14126 2026-07-17 cs.AI cs.CL cs.LG 新提交 67%

Interpretable Language Model for Closed-Loop Type 1 Diabetes Control

用于闭环1型糖尿病控制的可解释语言模型

Maya Sarkar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对1型糖尿病控制中人工胰腺系统“黑箱”问题,提出LLM-T1D方法,结合强化学习与大语言模型,训练专家RL系统并提炼知识到模型,开发出可解释且性能优的胰岛素泵控制器,在模拟器测试中血糖控制良好且能防幻觉。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering conference (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09008 2026-07-15 cs.CL cs.AI cs.LG cs.LO 版本更新 67%

A Neurosymbolic Approach to Natural Language Formalization and Verification

一种用于自然语言形式化和验证的神经符号方法

Chenyang An, Sam Bayless, Stefano Buliani, Darion Cassel, Byron Cook, Duncan Clough, Rémi Delmas, Nafi Diallo, Ferhat Erata, Nick Feng, Dimitra Giannakopoulou, Aman Goel, Aditya Gokhale, Joe Hendrix, Victor Heorhiadi, Marc Hudak, Dejan Jovanović, Andrew M. Kent, Benjamin Kiesl-Reiter, Jeffrey J. Kuna, Nadia Labai, Joseph Lilien, Divya Raghunathan, Zvonimir Rakamarić, Niloofar Razavi, Michael Tautschnig, Ali Torkamani, Nathaniel Weir, Michael W. Whalen, Jianan Yao

机构 * Amazon Web Services(亚马逊网络服务) University College London(伦敦大学学院) University of Toronto(多伦多大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27229 2026-07-08 cs.CL cs.AI cs.LG cs.NE 新提交 67%

CARVE: Content-Aware Recurrent with Value Efficiency for Chunk-Parallel Linear Attention

CARVE: 内容感知循环与值效率的分块并行线性注意力

Sayak Dutta

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CARVE模型,通过仅在键轴上擦除解决delta规则架构的三个耦合缺陷,实现WY形式分块求解器,在1.3B参数上取得WikiText困惑度15.72,优于GDN-2。

Comments 33 pages, 3 figures, 11 tables, 5 algorithms (incl. appendices with full proofs and Triton kernel pseudocode). Single-author preprint

详情

展开后加载摘要…

URL PDF HTML 收藏