arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1117 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1117 篇

2509.18604 2025-09-24 cond-mat.mtrl-sci 67%

A closed-loop AI framework for hypothesis-driven and interpretable materials design

Kangyu Ji, Tianran Liu, Fang Sheng, Shaun Tan, Moungi Bawendi, Tonio Buonassisi

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08641 2025-08-13 cs.LG cs.AI cs.CL 67%

MiGrATe: Mixed-Policy GRPO for Adaptation at Test-Time

Peter Phan, Dhruv Agarwal, Kavitha Srinivas, Horst Samulowitz, Pavan Kapanipathi, Andrew McCallum

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13158 2025-07-18 cs.LG cs.AI cs.CL 67%

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities

Hao Sun, Mihaela van der Schaar

机构 * Department of Applied Mathematics and Theoretical Physics(应用数学与理论物理系) University of Cambridge(剑桥大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06742 2025-07-10 cs.CR 67%

PenTest2.0: Towards Autonomous Privilege Escalation Using GenAI

Haitham S. Al-Sinani, Chris J. Mitchell

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract)

Comments 45 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12927 2025-06-17 cs.AI cs.CL cs.LG 67%

Sectoral Coupling in Linguistic State Space

Sebastian Dumbrava

机构 * Sebastian Dumbrava(独立研究者)

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 56 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19188 2025-04-29 cs.LG cs.AI cs.CL cs.LO 67%

Hierarchical Attention Generates Better Proofs

Jianlong Chen, Chao Li, Yang Yuan, Andrew C Yao

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学智能技术学院长)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages with 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15929 2025-04-23 cs.AI cs.CL cs.LG 67%

Certifying Knowledge Comprehension in LLMs

Isha Chaudhary, Vedaant V. Jain, Gagandeep Singh

机构 * Siebel School of Computing and Data Science University of Illinois, Urbana-Champaign(计算机与数据科学学院 伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10144 2025-04-09 cs.CL cs.AI cs.LG cs.LO cs.PL 67%

NLP Verification: Towards a General Methodology for Certifying Robustness

Marco Casadio, Tanvi Dinkar, Ekaterina Komendantskaya, Luca Arnaboldi, Matthew L. Daggitt, Omri Isac, Guy Katz, Verena Rieser, Oliver Lemon

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10878 2025-02-28 cs.CL cs.AI cs.LG cs.LO 67%

Herald: A Natural Language Annotated Lean 4 Dataset

Guoxiong Gao, Yutong Wang, Jiedong Jiang, Qi Gao, Zihan Qin, Tianyi Xu, Bin Dong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10949 2025-02-13 cs.CL cs.AI cs.LG 67%

Representing Rule-based Chatbots with Transformers

Dan Friedman, Abhishek Panigrahi, Danqi Chen

专题命中 代码与定理证明 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NAACL 2025. Code and data are available at https://github.com/princeton-nlp/ELIZA-Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04485 2025-02-10 cs.CL cs.AI cs.LG 67%

Active Task Disambiguation with LLMs

Katarzyna Kobalczyk, Nicolas Astorga, Tennison Liu, Mihaela van der Schaar

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13952 2024-12-19 cs.CL cs.AI cs.LG 67%

Prompting Strategies for Enabling Large Language Models to Infer Causation from Correlation

Eleni Sgouritsa, Virginia Aglietti, Yee Whye Teh, Arnaud Doucet, Arthur Gretton, Silvia Chiappa

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10665 2024-11-19 cs.CR 67%

AutoIoT: Automated IoT Platform Using Large Language Models

Ye Cheng, Minghui Xu, Yue Zhang, Kun Li, Ruoxi Wang, Lian Yang

专题命中 代码与定理证明 :reasoning(abstract);logical reasoning(abstract)

Comments 12 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11172 2024-08-22 cs.LG cs.AI cs.CL cs.LO 67%

SubgoalXL: Subgoal-based Expert Learning for Theorem Proving

Xueliang Zhao, Lin Zheng, Haige Bo, Changran Hu, Urmish Thakker, Lingpeng Kong

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09199 2024-08-20 cs.IR 67%

TC-RAG:Turing-Complete RAG's Case study on Medical LLM Systems

Xinke Jiang, Yue Fang, Rihong Qiu, Haoyu Zhang, Yongxin Xu, Hao Chen, Wentao Zhang, Ruizhe Zhang, Yuchen Fang, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)

Comments version 1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00798 2024-08-13 cs.LG cs.AI cs.CL cs.FL 67%

Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents

Zelong Li, Wenyue Hua, Hao Wang, He Zhu, Yongfeng Zhang

专题命中 代码与定理证明 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09629 2024-03-19 cs.CL cs.AI cs.LG 67%

Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Eric Zelikman, Georges Harik, Yijia Shao, Varuna Jayasiri, Nick Haber, Noah D. Goodman

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19791 2024-03-18 cs.CL cs.AI cs.LG cs.PL 67%

LILO: Learning Interpretable Libraries by Compressing and Documenting Code

Gabriel Grand, Lionel Wong, Maddy Bowers, Theo X. Olausson, Muxin Liu, Joshua B. Tenenbaum, Jacob Andreas

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07744 2024-02-15 cs.AI cs.CL cs.LG 67%

Towards Unified Alignment Between Agents, Humans, and Environment

Zonghan Yang, An Liu, Zijun Liu, Kaiming Liu, Fangzhou Xiong, Yile Wang, Zeyuan Yang, Qingyuan Hu, Xinrui Chen, Zhenhe Zhang, Fuwen Luo, Zhicheng Guo, Peng Li, Yang Liu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project webpage: https://agent-force.github.io/unified-alignment-for-agents.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07062 2023-09-14 cs.PL cs.AI cs.CL cs.LG 67%

Large Language Models for Compiler Optimization

Chris Cummins, Volker Seeker, Dejan Grubisic, Mostafa Elhoushi, Youwei Liang, Baptiste Roziere, Jonas Gehring, Fabian Gloeckle, Kim Hazelwood, Gabriel Synnaeve, Hugh Leather

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.06970 2019-08-21 cs.CR cs.MA 67%

Agent-based (BDI) modeling for automation of penetration testing

Ge Chu, Alexei Lisitsa

专题命中 代码与定理证明 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17017 2025-10-02 cs.AI cs.FL cs.LG cs.LO 66%

Neural Theorem Proving: Generating and Structuring Proofs for Formal Verification

Balaji Rao, William Eiers, Carlo Lipizzi

专题命中 代码与定理证明 :reasoning(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted to the Proceedings of the 19th Conference on Neurosymbolic Learning and Reasoning (NeSy 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.06972 2017-05-10 cs.AI cs.LG cs.LO 66%

Deep Network Guided Proof Search

Sarah Loos, Geoffrey Irving, Christian Szegedy, Cezary Kaliszyk

专题命中 代码与定理证明 :reasoning(abstract,journal_ref);分类 cs.AI、cs.LG

Journal ref In Thomas Eiter and David Sands, editors, 21st International Conference on Logic for Programming, Artificial Intelligence and Reasoning (LPAR-21). EPiC Series in Computing, vol. 46, pages 85-105, EasyChair, 2017. ISSN 2398-7340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-08-14 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06402 2026-08-10 cs.AI cs.LG 新提交 62%

Interpretable Unsupervised Community Detection with LLM-Symbolized Structured Processes

基于LLM符号化结构化过程的可解释无监督社区检测

Aoting Zeng, Kai Wang, Jianwei Wang, Yuxiang Sun, Yizhang He, Wenjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出LLM引导的无监督社区检测方法LUCID,通过四阶段流程结合LLM生成规则实现可解释性,在真实数据集上性能优于主流无监督与半监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22944 2026-07-28 cs.NI cs.AI cs.LG cs.SC 新提交 62%

Invariant Discovery for Networked Systems

网络系统的不变量发现

Hongyu Hè, Alexander Krentsel, Sylvia Ratnasamy, Maria Apostolaki

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究网络系统不变量发现问题,核心方法是将其分为人工智能驱动的语法“发现”与统计驱动的“搜索”问题,设计实现Autogram系统,贡献是能在多种数据上高覆盖率、低误报地恢复专家不变量并讨论开放问题。

Comments 8 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 62%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20503 2026-07-24 cs.AI cs.LG cs.LO 新提交 62%

LeanFlow: A Case Study in Workflow-Driven Lean Autoformalization

LeanFlow:工作流驱动的精益自动形式化案例研究

Lazar Milikic, Simon Guilloud, Khanh Nguyen, Viktor Kuncak

机构 * Moonshot AI(月球计划人工智能公司) epfl-lara(洛桑联邦理工学院拉腊实验室)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过对两篇数学论文案例研究,探讨文档到项目形式化中运行时机制对相关指标的影响,使用Kimi2.6和GPT5.5进行消融实验,报告多项数据,展示LeanFlow在特定任务上的表现及校准成果。

Comments 14 pages, 3 figures, ICML 2026: AI for Math Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17780 2026-07-21 cs.PL cs.AI cs.LG cs.MA 新提交 62%

ETAS: An Effect-Typed Language for Agent Systems

ETAS:一种用于智能体系统的效果类型化语言

Huiri Tan, Yikun Wang, Puyang Zhang, Shangyu Li, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对智能体系统设计ETAS语言,核心方法是通过规范一致性分配类型并用行为索引跟踪计算,主要贡献是为智能体执行相关推理提供编程语言基础,涵盖授权、非确定性等方面,还实现了该语言并形式化相关性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14165 2026-07-17 cs.SE cs.AI cs.AR cs.LG 新提交 62%

Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation

迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体

Dimple Vijay Kochar, Hae-Seung Lee, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏