arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2511.13007 2025-11-18 cs.AI cs.LG 79%

GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs

Yiyang Zhao, Huiyu Bai, Xuejiao Zhao

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted by AAAI 2026-AIA and designated as an oral presentation paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17612 2025-11-06 cs.CL cs.AI 79%

Distilling LLM Agent into Small Models with Retrieval and Code Tools

Minki Kang, Jongwon Jeong, Seanie Lee, Jaewoong Cho, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON(KRAFTON公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16421 2025-10-10 cs.CL cs.LG 79%

WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning

Zhepei Wei, Wenlin Yao, Yao Liu, Weizhi Zhang, Qin Lu, Liang Qiu, Changlong Yu, Puyang Xu, Chao Zhang, Bing Yin, Hyokun Yun, Lihong Li

机构 * University of Virginia(弗吉尼亚大学) Amazon(亚马逊) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025. Code: https://github.com/weizhepei/WebAgent-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08550 2025-09-23 cs.CL cs.AI 79%

No Need for Explanations: LLMs can implicitly learn from mistakes in-context

Lisa Alazraki, Maximilian Mozes, Jon Ander Campos, Tan Yi-Chern, Marek Rei, Max Bartolo

机构 * Imperial College London(伦敦帝国学院) Cohere

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15729 2025-09-10 cs.AI cs.CL cs.PL 79%

How Do Humans Write Code? Large Models Do It the Same Way Too

Long Li, Xuzheng He, Haozhe Wang, Linlin Wang, Liang He

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15969 2025-08-26 cs.CV cs.AI cs.CL 79%

Forgotten Polygons: Multimodal Large Language Models are Shape-Blind

William Rudman, Michal Golovanevsky, Amir Bar, Vedant Palit, Yann LeCun, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) IIT Kharagpur(印度理工学院卡里帕尔分校) New York University(纽约大学) University of Tübingen(图宾根大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12379 2025-07-17 cs.CL cs.AI 79%

Probing for Arithmetic Errors in Language Models

Yucheng Sun, Alessandro Stolfo, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07498 2025-07-15 cs.CL cs.LG 79%

Teaching LLM to Reason: Reinforcement Learning from Algorithmic Problems without Code

Keqin Bao, Nuo Chen, Xiaoyuan Li, Binyuan Hui, Bowen Yu, Fuli Feng, Xiangnan He, Dayiheng Liu

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14963 2025-03-28 cs.CL cs.AI 79%

Achieving >97% on GSM8K: Deeply Understanding the Problems Makes LLMs Better Solvers for Math Word Problems

Qihuang Zhong, Kang Wang, Ziyang Xu, Juhua Liu, Liang Ding, Bo Du

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: { 10.1007/s11704-025-41102-z }

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20339 2025-02-28 cs.CL cs.AI 79%

Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners

Daniele Paliotta, Junxiong Wang, Matteo Pagliardini, Kevin Y. Li, Aviv Bick, J. Zico Kolter, Albert Gu, François Fleuret, Tri Dao

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12853 2025-02-19 cs.CL cs.LG 79%

S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning

Ruotian Ma, Peisong Wang, Cheng Liu, Xingyan Liu, Jiaqi Chen, Bang Zhang, Xin Zhou, Nan Du, Jia Li

专题命中 数学推理 :reasoning(abstract);CoT(abstract);self-correction(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19113 2024-12-30 cs.CL cs.DB cs.LG 79%

SketchFill: Sketch-Guided Code Generation for Imputing Derived Missing Values

Yunfan Zhang, Changlun Li, Yuyu Luo, Nan Tang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13697 2024-09-24 cs.CL cs.AI 79%

Prompt Baking

Aman Bhargava, Cameron Witkowski, Alexander Detkov, Matt Thomson

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11319 2024-08-27 cs.CL cs.AI 79%

SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding

Yazhou Zhang, Chunwang Zou, Zheng Lian, Prayag Tiwari, Jing Qin

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06979 2024-07-31 cs.LG cs.CL 79%

Auto-Regressive Next-Token Predictors are Universal Learners

Eran Malach

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14681 2024-02-22 cs.LG cs.AI 79%

Are Human-generated Demonstrations Necessary for In-context Learning?

Rui Li, Guoyin Wang, Jiwei Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15408 2023-12-27 cs.LG cs.CC cs.CL stat.ML 79%

Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective

Guhao Feng, Bohang Zhang, Yuntian Gu, Haotian Ye, Di He, Liwei Wang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments 42 pages; Camera-ready version for NeurIPS 2023 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09561 2023-10-20 cs.AI cs.CL 79%

Large Language Models are Better Reasoners with Self-Verification

Yixuan Weng, Minjun Zhu, Fei Xia, Bin Li, Shizhu He, Shengping Liu, Bin Sun, Kang Liu, Jun Zhao

专题命中 数学推理 :reasoning(abstract);CoT(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments Accept in EMNLP 2023 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09656 2023-10-13 cs.CL cs.AI 79%

SatLM: Satisfiability-Aided Language Models Using Declarative Prompting

Xi Ye, Qiaochu Chen, Isil Dillig, Greg Durrett

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01326 2022-12-12 cs.CL cs.AI 79%

Legal Prompting: Teaching a Language Model to Think Like a Lawyer

Fangyi Yu, Lee Quartey, Frank Schilder

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 6 figures, 4 tables. Accepted by NLLP 2022 (EMNLP workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02392 2025-03-03 cs.LG stat.ML 78%

Building Math Agents with Multi-Turn Iterative Preference Learning

Wei Xiong, Chengshuai Shi, Jiaming Shen, Aviv Rosenberg, Zhen Qin, Daniele Calandriello, Misha Khalman, Rishabh Joshi, Bilal Piot, Mohammad Saleh, Chi Jin, Tong Zhang, Tianqi Liu

专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

Comments A multi-turn direct preference learning framework for tool-integrated reasoning tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-08-11 cs.CV 新提交 78%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 78%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01692 2026-07-03 cs.HC 新提交 78%

From Answer Generators to Reasoning Facilitators: Designing AI Tutors for Mathematical Reasoning in High-Stakes Environments

从答案生成器到推理促进者:为高风险环境中的数学推理设计AI导师

Yuming Feng, Yuan Tian, Erica Zhao

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本研究设计并部署了AITutor系统,通过分层工作示例、步骤链接视觉基础和元认知支架等功能,帮助初中生在高压考试中从被动获取答案转向主动修复推理过程,提出了以推理为中心的产品循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22075 2026-07-01 cs.CV 版本更新 78%

Reasoning in machine vision by learning fast and slow thinking

通过快速与慢速思考学习进行机器视觉推理

Shaheer U. Saeed, Yipei Wang, Veeru Kasivisvanathan, Brian R. Davidson, Matthew J. Clarkson, Yipeng Hu, Daniel C. Alexander

机构 * Centre for Bioengineering, Queen Mary University of London(伦敦玛丽女王大学生物工程中心) Digital Environment Research Institute, Queen Mary University of London(伦敦玛丽女王大学数字环境研究所) School of Engineering and Materials Science, Queen Mary University of London(伦敦玛丽女王大学工程与材料科学学院) UCL Hawkes Institute, University College London(伦敦大学学院UCL霍克斯研究所) Department of Medical Physics and Biomedical Engineering, University College London(伦敦大学学院医学物理与生物医学工程系) Centre for Urology Imaging, Prostate, AI and Surgical Studies (COMPASS) Research Group, Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部泌尿影像、前列腺、人工智能与手术研究(COMPASS)组中心) Department of Urology, Comprehensive Cancer Center, Medical University of Vienna(维也纳医科大学综合癌症中心泌尿科) Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 受人类双过程认知理论启发,提出结合快速系统I和慢速系统II的视觉推理范式,通过推理时计算提升数据稀缺场景下的性能,在计算机视觉基准和五器官癌症定位任务中超越大规模监督学习和人类专家。

Journal ref Nat Commun (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19427 2026-06-19 astro-ph.CO astro-ph.IM physics.comp-ph physics.data-an 新提交 78%

Physics-guided discovery of dynamical dark-energy equations of state through iterative AI reasoning

通过迭代AI推理发现动力学暗能量状态方程的物理引导

Clecio R. Bom, Bernardo M. Fraga, Miguel A. Sabogal, Armando Bernui, Phelipe Darc, Gustavo Schwarz

专题命中 数学推理 :reasoning(title,abstract)

AI总结 提出迭代AI推理框架,利用大语言模型生成并优化暗能量状态方程,结合文献检索和自动评估,发现两种新参数化形式,在超新星、重子声学振荡和Planck数据上优于传统模型。

Comments 6 figures, 45 pages, submitted. Code: https://iadev.cbpf.br/labia/cosmoai

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19945 2026-06-15 cs.CR 版本更新 78%

Multi-LLM Energy Reasoning for Binary-Free Zero-Day IoT Detection

多LLM能量推理用于无二进制零日物联网检测

Saeid Jamshidi, Foutse Khomh, Kawser Wazed Nafi, Omar Abdul-Wahab, Martine Bellaïche

专题命中 数学推理 :reasoning(title,abstract)

AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25155 2026-04-29 eess.SP 78%

Rethinking Wireless Communications through Formal Mathematical AI Reasoning

通过形式数学AI推理重新思考无线通信

Changyuan Zhao, Jiacheng Wang, Dusit Niyato, Zan Li, Abbas Jamalipour, Shiwen Mao, Xianbin Wang, Dong In Kim

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出通过形式数学AI推理重新构建无线通信理论,提出验证、推导和发现三层框架,推动无线数学知识的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24869 2026-04-16 cs.CV 78%

SiLVR: A Simple Language-based Video Reasoning Framework

SiLVR:一种简单的基于语言的视频推理框架

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius

机构 * Department of Computer Science(计算机科学系) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。

Comments Accepted by TMLR (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10387 2026-04-15 cs.DC 78%

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping

利用大语言模型的数学推理实现高效的GPU线程映射

Jose Maureira, Cristóbal A. Navarro, Hector Ferrada, Luis Veas-Castillo

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出利用大语言模型的符号推理自动化GPU非矩形域线程映射,通过上下文学习推导出精确的O(1)和O(log N)映射方程,显著优于传统符号回归方法,实现高效能资源优化。

Comments 11 pages, 5 figures, 8 tables. Submitted to IEEE Transactions on Parallel and Distributed Systems (TPDS)

详情

展开后加载摘要…

URL PDF HTML 收藏