arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 代码与定理证明 1129 篇

2505.10982 2025-05-19 cs.AI 57%

Facets in Argumentation: A Formal Approach to Argument Significance

Johannes Fichte, Nicolas Fröhlich, Markus Hecher, Victor Lagerkvist, Yasir Mahmood, Arne Meier, Jonathan Persson

机构 * Department of Computer and Information Science, Linköping University, Sweden(林雪平大学计算机与信息科学系) Leibniz Universität Hannover, Germany(汉诺威莱布尼茨大学) Univ. Artois, CNRS, France(阿诺伊大学) CSAIL, Massachusetts Institute of Technology, USA(麻省理工学院计算机科学与人工智能实验室) DICE group, Paderborn University, Germany(波德生大学DICE小组)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10962 2025-05-19 cs.AI 57%

MPS-Prover: Advancing Stepwise Theorem Proving by Multi-Perspective Search and Data Curation

Zhenwen Liang, Linfeng Song, Yang Li, Tao Yang, Feng Zhang, Haitao Mi, Dong Yu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10387 2025-05-16 cs.MA cs.AI cs.CC 57%

Multi-Agent Path Finding For Large Agents Is Intractable

Artem Agafonov, Konstantin Yakovlev

机构 * HSE University(莫斯科国立高等经济大学) FRC CSC RAS(俄罗斯科学院应用系统分析研究所) AIRI(人工智能研究所)

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08532 2025-05-14 cs.SI cs.AI 57%

The Truth Becomes Clearer Through Debate! Multi-Agent Systems with Large Language Models Unmask Fake News

Yuhan Liu, Yuxuan Liu, Xiaoqing Zhang, Xiuying Chen, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(仁爱大学人工智能学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19112 2025-05-13 cs.AI cs.CY cs.LO 57%

Logical Modalities within the European AI Act: An Analysis

Lara Lawniczak, Christoph Benzmüller

机构 * University of Bamberg(巴姆堡大学) Freie Universität Berlin(柏林自由大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments Extended preprint of paper accepted for ICAIL 2025; 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03171 2025-05-07 cs.AI 57%

CombiBench: Benchmarking LLM Capability for Combinatorial Mathematics

Junqi Liu, Xiaohan Lin, Jonas Bayer, Yael Dillies, Weijie Jiang, Xiaodan Liang, Roman Soletskyi, Haiming Wang, Yunzhou Xie, Beibei Xiong, Zhengfeng Yang, Jujian Zhang, Lihong Zhi, Jia Li, Zhengying Liu

机构 * Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Sun Yat-sen University(中山大学) University of Cambridge(剑桥大学) East China Normal University(华东师范大学) Imperial College London(伦敦帝国理工学院) Stockholm Universitet(斯德哥尔摩大学) Numina Moonshot AI

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00841 2025-05-05 cs.CR cs.AI 57%

From Texts to Shields: Convergence of Large Language Models and Cybersecurity

Tao Li, Ya-Ting Yang, Yunian Pan, Quanyan Zhu

机构 * New York University(纽约大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11901 2025-04-15 cs.CL cs.PL cs.SE 57%

Building A Proof-Oriented Programmer That Is 64% Better Than GPT-4o Under Data Scarcity

Dylan Zhang, Justin Wang, Tianran Sun

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09067 2025-04-08 cs.CV cs.CL q-bio.NC 57%

Interpreting the structure of multi-object representations in vision encoders

Tarun Khajuria, Braian Olmiro Dias, Marharyta Domnich, Jaan Aru

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06967 2025-04-03 cs.AI cs.LO 57%

Data quality dimensions for fair AI

Camilla Quaresmini, Giuseppe Primiero

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00063 2025-04-02 cs.AI math.LO 57%

The Axiom-Based Atlas: A Structural Mapping of Theorems via Foundational Proof Vectors

Harim Yoo

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20561 2025-03-27 cs.LG stat.ML 57%

A Theoretical Framework for Prompt Engineering: Approximating Smooth Functions with Transformer Prompts

Ryumei Nakada, Wenlong Ji, Tianxi Cai, James Zou, Linjun Zhang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

Comments 55 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18899 2025-03-25 cs.AI cs.CR 57%

Statistical Proof of Execution (SPEX)

Michele Dallachiesa, Antonio Pitasi, David Pinger, Josh Goodbody, Luis Vaello

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10694 2025-03-17 cs.CL 57%

Medical Large Language Model Benchmarks Should Prioritize Construct Validity

Ahmed Alaa, Thomas Hartvigsen, Niloufar Golchini, Shiladitya Dutta, Frances Dean, Inioluwa Deborah Raji, Travis Zack

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07172 2025-03-11 cs.AI cs.LO cs.SE 57%

Lawful and Accountable Personal Data Processing with GDPR-based Access and Usage Control in Distributed Systems

L. Thomas van Binsbergen, Marten C. Steketee, Milen G. Kebede, Heleen L. Janssen, Tom M. van Engers

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments Submitted for review to the Journal of AI and Law, 49 pages (including)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03911 2025-03-07 cs.RO cs.LG cs.SY eess.SY 57%

Safe LLM-Controlled Robots with Formal Guarantees via Reachability Analysis

Ahmad Hafez, Alireza Naderi Akhormeh, Amr Hegazy, Amr Alanwar

专题命中 代码与定理证明 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03840 2025-03-07 cs.CV cs.LG 57%

Decoupling the components of geometric understanding in Vision Language Models

Eliza Kosoy, Annya Dahmani, Andrew K. Lampinen, Iulia M. Comsa, Soojin Jeong, Ishita Dasgupta, Kelsey Allen

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11113 2025-02-19 cs.CL 57%

Valuable Hallucinations: Realizable Non-realistic Propositions

Qiucheng Chen, Bo Wang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09913 2025-01-20 cs.AI 57%

Towards A Litmus Test for Common Sense

Hugo Latapie

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00900 2025-01-20 cs.SE cs.AI 57%

Large Process Models: A Vision for Business Process Management in the Age of Generative AI

Timotheus Kampik, Christian Warmuth, Adrian Rebmann, Ron Agam, Lukas N. P. Egger, Andreas Gerber, Johannes Hoffart, Jonas Kolk, Philipp Herzig, Gero Decker, Han van der Aa, Artem Polyvyanyy, Stefanie Rinderle-Ma, Ingo Weber, Matthias Weidlich

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Journal ref Künstl Intell (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01992 2025-01-07 cs.AI cs.LO cs.MA 57%

Disagree and Commit: Degrees of Argumentation-based Agreements

Timotheus Kampik, Juan Carlos Nieves

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

Comments To appear eventually in the Autonomous Agents and Multi-Agent Systems journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01732 2025-01-06 cs.CR cs.AI cs.NI 57%

Combined Hyper-Extensible Extremely-Secured Zero-Trust CIAM-PAM architecture

Shivom Aggarwal, Shourya Mehra, Safeer Sathar

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01257 2025-01-06 cs.CL 57%

CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings

Shanghaoran Quan, Jiaxi Yang, Bowen Yu, Bo Zheng, Dayiheng Liu, An Yang, Xuancheng Ren, Bofei Gao, Yibo Miao, Yunlong Feng, Zekun Wang, Jian Yang, Zeyu Cui, Yang Fan, Yichang Zhang, Binyuan Hui, Junyang Lin

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21199 2025-01-03 cs.SE cs.CL 57%

HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation

Zhaojian Yu, Yilun Zhao, Arman Cohan, Xiao-Ping Zhang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07636 2024-12-11 cs.CR cs.AI 57%

TrojanWhisper: Evaluating Pre-trained LLMs to Detect and Localize Hardware Trojans

Md Omar Faruque, Peter Jamieson, Ahmad Patooghy, Abdel-Hameed A. Badawy

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15143 2024-11-26 cs.SE cs.AI cs.PL 57%

dafny-annotator: AI-Assisted Verification of Dafny Programs

Gabriel Poesia, Chloe Loughridge, Nada Amin

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13627 2024-11-22 cs.CR cs.AI cs.SC 57%

CryptoFormalEval: Integrating LLMs and Formal Verification for Automated Cryptographic Protocol Vulnerability Detection

Cristian Curaba, Denis D'Ambrosi, Alessandro Minisini, Natalia Pérez-Campanero Antolín

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05977 2024-11-11 cs.CL 57%

Mathematical Formalized Problem Solving and Theorem Proving in Different Fields in Lean 4

Xichen Tang

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00828 2024-11-05 cs.CV cs.LG 57%

Dreaming Out Loud: A Self-Synthesis Approach For Training Vision-Language Models With Developmentally Plausible Data

Badr AlKhamissi, Yingtian Tang, Abdülkadir Gökce, Johannes Mehrer, Martin Schrimpf

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.LG

Comments Accepted to BabyLM Challenge at CoNLL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00188 2024-11-04 cs.AI cs.IR 57%

Building Multi-Agent Copilot towards Autonomous Agricultural Data Management and Analysis

Yu Pan, Jianxin Sun, Hongfeng Yu, Joe Luck, Geng Bai, Nipuna Chamara, Yufeng Ge, Tala Awada

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏