arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2505.14756 2025-10-10 cs.LG cs.AI 62%

LLINBO: Trustworthy LLM-in-the-Loop Bayesian Optimization

Chih-Yu Chang, Milad Azvar, Chinedum Okwudire, Raed Al Kontar

机构 * University of Michigan(密歇根大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01272 2025-10-03 cs.AI cs.LG 62%

Modeling Others' Minds as Code

Kunal Jha, Aydan Yuenan Huang, Eric Ye, Natasha Jaques, Max Kleiman-Weiner

机构 * Department of Computer Science, University of Washington(华盛顿大学计算机科学系) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25343 2025-10-01 cs.AI cs.CL 62%

Spontaneous High-Order Generalization in Neural Theory-of-Mind Networks

Yiming Wang, Rui Wang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09871 2025-09-22 cs.CL cs.AI 62%

Emulating Public Opinion: A Proof-of-Concept of AI-Generated Synthetic Survey Responses for the Chilean Case

Bastián González-Bustamante, Nando Verelst, Carla Cisternas

机构 * Universidad Diego Portales(迪亚戈·波特莱斯大学) Leiden University(莱顿大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Working paper: 18 pages, 4 tables, 2 figures

Journal ref Empiria Lab Method Series (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12233 2025-09-17 cs.CR cs.AI cs.ET cs.LG cs.NI 62%

Towards Trustworthy Agentic IoEV: AI Agents for Explainable Cyberthreat Mitigation and State Analytics

Meryem Malak Dif, Mouhamed Amine Bouchiha, Abdelaziz Amara Korba, Yacine Ghamri-Doudane

机构 * L3i - La Rochelle University, La Rochelle, France(L3i - 拉罗谢尔大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures, Accepted at LCN'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06902 2025-09-09 cs.CL cs.CR cs.DB cs.LG 62%

Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification

Aivin V. Solatorio

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01716 2025-09-03 cs.AI cs.CL 62%

An LLM-enabled semantic-centric framework to consume privacy policies

Rui Zhao, Vladyslav Melnychuk, Jun Zhao, Jesse Wright, Nigel Shadbolt

机构 * University of Oxford(牛津大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14870 2025-08-29 cs.LO cs.AI cs.LG 62%

Application of AI to formal methods - an analysis of current trends

Sebastian Stock, Jannik Dunkelau, Atif Mashkoor

机构 * Institute of Software System Engineering(软件系统工程研究所) Johannes Kepler University Linz(约翰·凯撒大学林茨分校) Faculty of Mathematics and Natural Sciences(数学与自然科学学院) Heinrich Heine University Düsseldorf(海因里希·海涅大学杜塞尔多夫分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14275 2025-08-21 cs.CL cs.AI 62%

Disentangling concept semantics via multilingual averaging in Sparse Autoencoders

Cliff O'Reilly, Ernesto Jimenez-Ruiz, Tillman Weyde

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06017 2025-08-11 cs.SE cs.CL cs.LG 62%

Position: Intelligent Coding Systems Should Write Programs with Justifications

Xiangzhe Xu, Shiwei Feng, Zian Su, Chengpeng Wang, Xiangyu Zhang

机构 * Purdue University(普渡大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02584 2025-08-05 cs.CL cs.AI 62%

MArgE: Meshing Argumentative Evidence from Multiple Large Language Models for Justifiable Claim Verification

Ming Pok Ng, Junqi Jiang, Gabriel Freedman, Antonio Rago, Francesca Toni

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14722 2025-07-22 cs.LG cs.AI 62%

LeanTree: Accelerating White-Box Proof Search with Factorized States in Lean 4

Matěj Kripner, Michal Šustr, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系) Czech Technical University, Faculty of Electrical Engineering(捷克技术大学电气工程系)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02726 2025-07-04 cs.AI cs.LG 62%

Bourbaki: Self-Generated and Goal-Conditioned MDPs for Theorem Proving

Matthieu Zimmer, Xiaotong Ji, Rasul Tutunov, Anthony Bordg, Jun Wang, Haitham Bou Ammar

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Imperial College London(伦敦帝国学院) Huawei Lagrange Center(华为拉格朗日中心) UCL Centre for AI(大学学院人工智能中心)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17161 2025-06-19 cs.CL cs.LG cs.LO 62%

Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence

İlker Işık, Ramazan Gokberk Cinbis, Ebru Aydin Gol

机构 * Department of Computer Engineering, Middle East Technical University, Ankara, Turkey(中欧技术大学计算机工程系) Microsoft, İstanbul, Turkey(微软公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

Comments ICML 2025 Poster Paper, Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13172 2025-06-18 cs.CL cs.AI 62%

AI-Facilitated Analysis of Abstracts and Conclusions: Flagging Unsubstantiated Claims and Ambiguous Pronouns

Evgeny Markhasin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16207 2025-06-10 cs.AI cs.CL cs.PL 62%

From Informal to Formal -- Incorporating and Evaluating LLMs on Natural Language Requirements to Verifiable Formal Proofs

Jialun Cao, Yaojie Lu, Meiziniu Li, Haoyang Ma, Haokun Li, Mengda He, Cheng Wen, Le Sun, Hongyu Zhang, Shengchao Qin, Shing-Chi Cheung, Cong Tian

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) Chongqing University(重庆大学) ICTT and ISN Laboratory, Xidian University(西安电子科技大学ICTT和ISN实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06046 2025-05-30 cs.CR cs.AI cs.CL 62%

LLM for SoC Security: A Paradigm Shift

Dipayan Saha, Shams Tarek, Katayoon Yahyaei, Sujan Kumar Saha, Jingbo Zhou, Mark Tehranipoor, Farimah Farahmandi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13484 2025-05-21 cs.AI cs.CL 62%

Evaluating Large Language Models for Real-World Engineering Tasks

Rene Heesch, Sebastian Eilermann, Alexander Windmann, Alexander Diedrich, Philipp Rosenthal, Oliver Niggemann

机构 * Helmut Schmidt University(海德堡-哈雷大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07107 2025-04-15 cs.CL cs.LG 62%

Training Neural Networks as Recognizers of Formal Languages

Alexandra Butoi, Ghazal Khalighinejad, Anej Svete, Josef Valvoda, Ryan Cotterell, Brian DuSell

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 44 pages, 3 figures. ICLR 2025. Official camera-ready version; applies minor corrections to previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16533 2025-03-24 cs.CL cs.AI 62%

From Patient Consultations to Graphs: Leveraging LLMs for Patient Journey Knowledge Graph Construction

Hassan S. Al Khatib, Sudip Mittal, Shahram Rahimi, Nina Marhamati, Sean Bozorgzad

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13508 2025-03-19 cs.CL cs.AI cs.CY 62%

It is Too Many Options: Pitfalls of Multiple-Choice Questions in Generative AI and Medical Education

Shrutika Singh, Anton Alyakin, Daniel Alexander Alber, Jaden Stryker, Ai Phuong S Tong, Karl Sangwon, Nicolas Goff, Mathew de la Paz, Miguel Hernandez-Rovira, Ki Yun Park, Eric Claude Leuthardt, Eric Karl Oermann

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06366 2025-03-11 cs.LG cs.AI math.CO math.RT 62%

Machine Learning meets Algebraic Combinatorics: A Suite of Datasets Capturing Research-level Conjecturing Ability in Pure Mathematics

Herman Chau, Helen Jenne, Davis Brown, Jesse He, Mark Raugas, Sara Billey, Henry Kvinge

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 26 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05346 2025-03-10 cs.CL cs.AI cs.SE 62%

AutoIOT: LLM-Driven Automated Natural Language Programming for AIoT Applications

Leming Shen, Qiang Yang, Yuanqing Zheng, Mo Li

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06209 2025-03-07 cs.LG cs.AI cs.LO 62%

LeanAgent: Lifelong Learning for Formal Theorem Proving

Adarsh Kumarappan, Mo Tiwari, Peiyang Song, Robert Joseph George, Chaowei Xiao, Anima Anandkumar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00093 2025-03-04 cs.CY cs.AI cs.CL 62%

Rethinking LLM Bias Probing Using Lessons from the Social Sciences

Kirsten N. Morehouse, Siddharth Swaroop, Weiwei Pan

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21290 2025-03-03 cs.AI cs.LG q-bio.QM 62%

Contextualizing biological perturbation experiments through language

Menghua Wu, Russell Littman, Jacob Levine, Lin Qiu, Tommaso Biancalani, David Richmond, Jan-Christian Huetter

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

Comments The Thirteenth International Conference on Learning Representations (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18532 2025-02-27 cs.AI cs.LG 62%

CuDIP: Enhancing Theorem Proving in LLMs via Curriculum Learning-based Direct Preference Optimization

Shuming Shi, Ruobing Zuo, Gaolei He, Jianlin Wang, Chenyang Xu, Zhengfeng Yang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15797 2025-02-11 cs.LG cs.CL cs.IR 62%

LemmaHead: RAG Assisted Proof Generation Using Large Language Models

Tianbo Yang, Mingqi Yan, Hongyi Zhao, Tianshuo Yang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09005 2025-01-09 cs.CR cs.AI cs.ET cs.GT cs.LG 62%

Proof-of-Learning with Incentive Security

Zishuo Zhao, Zhixuan Fang, Xuechao Wang, Xi Chen, Hongxu Su, Haibo Xiao, Yuan Zhou

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01827 2025-01-06 cs.CL cs.AI 62%

The Proof is in the Almond Cookies

Remi van Trijp, Katrien Beuls, Paul Van Eecke

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI

Journal ref In Steels, L. & Porzel, R. (eds). 2024. Narrative-based Understanding of Everyday Activities: A Cookbook. Venice: Venice International University. Pages 59-77

详情

展开后加载摘要…

URL PDF HTML 收藏