arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3218 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2512.07871 2025-12-10 quant-ph cs.AI 79%

Quantum Circuit Reasoning Models: A Variational Framework for Differentiable Logical Inference

量子电路推理模型:一种用于可微逻辑推理的变分框架

Andrew Kiruluta

机构 * UC Berkeley, School of Information(伯克利大学信息学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 量子电路推理模型通过变分框架实现可微逻辑推理,将量子力学操作映射到推理原语,用于科学、生物医学和化学领域的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16401 2025-12-09 cs.LG 79%

Exploring the Hidden Reasoning Process of Large Language Models by Misleading Them

通过误导性训练探索大型语言模型的隐藏推理过程

Guanyu Chen, Peiyang Wang, Yizhou Jiang, Yuqian Liu, Chujie Zhao, Ying Fang, Tianren Zhang, Feng Chen

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) College of Computer and Cyber Security, Fujian Normal University(计算机与网络安全学院,福建师范大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文通过误导性训练方法探索LLMs的隐藏推理过程,发现其具备在任务抽象前进行推理的内部机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04355 2025-12-05 cs.DC cs.AI cs.PF 79%

Counting Without Running: Evaluating LLMs' Reasoning About Code Complexity

无需运行即可计数:评估LLM对代码复杂度的推理能力

Gregory Bolet, Giorgis Georgakoudis, Konstantinos Parasyris, Harshitha Menon, Niranjan Hasabnis, Kirk W. Cameron, Gal Oren

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出gpuFLOPBench基准测试,评估LLM在无需运行代码的情况下预测CUDA内核FLOP计数的能力,揭示现有代码助手在硬件特定微码效应方面的局限性。

Comments 13 pages, 6 figures, MLSys 2026 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00552 2025-12-02 cs.CL 79%

Catch Me If You Can: How Smaller Reasoning Models Pretend to Reason with Mathematical Fidelity

捉摸不到:为何小型推理模型用数学严谨性伪装推理

Subramanyam Sahoo, Vinija Jain, Saanidhya Vats, Siddharth Mohapatra, Rui Min, Aman Chadha, Divya Chaudhary

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究提出诊断框架,揭示小型模型依赖模式匹配而非真实逻辑计算,通过四个轴线评估推理忠实性,推动可验证的数学推理研究。

Comments 8 pages, 5 figures. A preprint. Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27044 2025-12-02 cs.LG 79%

Limits of Generalization in RLVR: Two Case Studies in Mathematical Reasoning

RLVR在数学推理中的泛化极限:两个案例研究

Md Tanvirul Alam, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 RLVR在数学推理任务中通过强化表面启发式方法提升指标,但难以获得真实推理策略,凸显其泛化能力的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19333 2025-11-25 cs.CL 79%

Learning to Reason: Training LLMs with GPT-OSS or DeepSeek R1 Reasoning Traces

学习推理:通过GPT-OSS或DeepSeek R1推理轨迹训练LLMs

Shaltiel Shmidman, Asher Fredman, Oleg Sudakov, Meriem Bendris

机构 * DICTA NVIDIA

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究通过比较DeepSeek-R1和gpt-oss生成的推理轨迹对中型LLMs在数学问题上的微调效果,评估了推理轨迹在提升模型推理能力中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08987 2025-11-21 cs.AI 79%

Towards Efficient Multimodal Unified Reasoning Model via Model Merging

通过模型合并实现高效的多模态统一推理模型

Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部交互技术与体验系统重点实验室) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Tiny-R1V通过两阶段优化和模型合并方法,实现高效多模态推理,提升轻量模型在多种任务中的性能。

Comments Technical report, Code will be available at https://github.com/buptyqx/Tiny-R1V

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13404 2025-11-19 cs.AI 79%

Effective Learning for Small Reasoning Models: An Empirical Study on 0.5B Reasoning LLMs

Xialie Zhuang, Peixian Ma, Zhikai Jia, Zane Cao, Shiwei Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SCITIX (SGP) TECH PTE. LTD.(SCITIX(SGP)技术有限公司) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13016 2025-11-18 cs.LG 79%

The Good, The Bad, and The Hybrid: A Reward Structure Showdown in Reasoning Models Training

Subramanyam Sahoo

机构 * Berkeley AI Safety Initiative (BASIS) UC Berkeley(伯克利人工智能安全计划(BASIS)加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

Comments Paper accepted to the 2nd Workshop on Aligning Reinforcement Learning Experimentalists and Theorists (ARLET 2025) at NeurIPS; the paper consists of 14 pages (including the appendix) and contains 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09158 2025-11-13 cs.AI 79%

Efficient Reasoning via Reward Model

Yuhao Wang, Xiaopeng Li, Cheng Gong, Ziru Liu, Suiyun Zhang, Rui Liu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03133 2025-11-13 cs.CL 79%

ReliableMath: Benchmark of Reliable Mathematical Reasoning on Large Language Models

Boyang Xue, Qi Zhu, Rui Wang, Sheng Wang, Hongru Wang, Minda Hu, Fei Mi, Yasheng Wang, Lifeng Shang, Qun Liu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08055 2025-11-12 cs.AI 79%

MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement

Zhishen Sun, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20166 2025-11-12 cs.CR cs.AI 79%

CyberSOCEval: Benchmarking LLMs Capabilities for Malware Analysis and Threat Intelligence Reasoning

Lauren Deason, Adam Bali, Ciprian Bejean, Diana Bolocan, James Crnkovich, Ioana Croitoru, Krishna Durai, Chase Midler, Calin Miron, David Molnar, Brad Moon, Bruno Ostarcevic, Alberto Peltea, Matt Rosenberg, Catalin Sandu, Arthur Saputkin, Sagar Shah, Daniel Stan, Ernest Szocs, Shengye Wan, Spencer Whitman, Sven Krasser, Joshua Saxe

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07396 2025-11-11 cs.LG 79%

C3PO: Optimized Large Language Model Cascades with Probabilistic Cost Constraints for Reasoning

Antonios Valkanas, Soumyasundar Pal, Pavel Rumiantsev, Yingxue Zhang, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Int. Lab. Learning Systems(国际学习系统实验室) Huawei Montréal, Canada(华为蒙特利尔加拿大分公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22342 2025-11-11 cs.AI 79%

CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models

Zhihang Lin, Mingbao Lin, Yuan Xie, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Shanghai Innovation Institute(上海创新研究院) Rakuten, Singapore(新加坡Rakuten公司) East China Normal University, Shanghai, China(上海教育学院,中国)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04800 2025-11-10 cs.CL 79%

Explore Data Left Behind in Reinforcement Learning for Reasoning Language Models

Chenxi Liu, Junjie Liang, Yuqi Jia, Bochuan Cao, Yang Bai, Heng Huang, Xun Chen

机构 * University of Maryland, College Park(马里兰大学学院市分校) ByteDance(字节跳动) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17803 2025-11-10 cs.CL 79%

DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language Models

Kaiwen Yan, Xuanqing Shi, Hongcheng Guo, Wenxuan Wang, Zhuosheng Zhang, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18428 2025-11-04 cs.CL 79%

PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts

Yiming Wang, Pei Zhang, Jialong Tang, Haoran Wei, Baosong Yang, Rui Wang, Chenshu Sun, Feitong Sun, Jiran Zhang, Junxuan Wu, Qiqian Cang, Yichang Zhang, Fei Huang, Junyang Lin, Fei Huang, Jingren Zhou

机构 * Qwen Team, Alibaba Group(阿里集团Qwen团队) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22132 2025-10-28 cs.AI 79%

Controllable Mathematical Reasoning via Self-Optimizing Thought Vectors

Xuying LI

机构 * Kepler(开普勒)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21398 2025-10-27 cs.AI 79%

Boosting Accuracy and Efficiency of Budget Forcing in LLMs via Reinforcement Learning for Mathematical Reasoning

Ravindra Aribowo Tarunokusumo, Rafael Fernandes Cunha

机构 * University of Groningen(格罗宁根大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments Submitted to the European Conference on Artificial Intelligence (ECAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04723 2025-10-27 cs.AI 79%

Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning

Jiayu Wang, Yifei Ming, Zixuan Ke, Caiming Xiong, Shafiq Joty, Aws Albarghouthi, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Salesforce AI Research(Salesforce AI研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18470 2025-10-24 cs.AI 79%

CircuitSeer: Mining High-Quality Data by Probing Mathematical Reasoning Circuits in LLMs

Shaobo Wang, Yongliang Miao, Yuancheng Liu, Qianli Ma, Ning Liao, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17190 2025-10-24 cs.LG math.AG math.CO 79%

Tropical Attention: Neural Algorithmic Reasoning for Combinatorial Algorithms

Baran Hashemi, Kurt Pasque, Chris Teska, Ruriko Yoshida

机构 * Origins Data Science Lab(Origins数据科学实验室) Technical University of Munich(慕尼黑技术大学) Naval Postgraduate School(海军研究生学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18032 2025-10-22 cs.AI cs.MA 79%

OPTAGENT: Optimizing Multi-Agent LLM Interactions Through Verbal Reinforcement Learning for Enhanced Reasoning

Zhenyu Bi, Meng Lu, Yang Li, Swastik Roy, Weijie Guan, Morteza Ziyadi, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学) College of William and Mary(威廉与玛丽学院) Amazon Alexa AI(亚马逊Alexa人工智能)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

Comments 8 pages for main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11652 2025-10-14 cs.CL 79%

ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems

Xin Gui, King Zhu, JinCheng Ren, Qianben Chen, Zekun Moore Wang, Yizhi LI, Xinpeng Liu, Xiaowan Li, Wenli Ren, Linyu Miao, Tianrui Qin, Ziqi Shu, He Zhu, Xiangru Tang, Dingfeng Shi, Jiaheng Liu, Yuchen Eleanor Jiang, Minghao Liu, Ge Zhang, Wangchunshu Zhou

机构 * OPPO AI Agent Team(OPPO 人工智能代理团队)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10974 2025-10-14 cs.CL 79%

Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning

Zhiwen Ruan, Yixia Li, He Zhu, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai University of Finance and Economics(上海金融学院) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04617 2025-10-14 cs.AI 79%

Making Mathematical Reasoning Adaptive

Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shujian Huang

机构 * Nanjing University(南京大学) Meituan Inc.(美团公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08595 2025-10-13 cs.CL 79%

Systematic Diagnosis of Brittle Reasoning in Large Language Models

V. S. Raghu Parupudi

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

Comments Submitted to NEURIPS-2025 MATHAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19418 2025-10-13 cs.CL 79%

Learning to Disentangle Latent Reasoning Rules with Language VAEs: A Systematic Study

Yingji Zhang, Marco Valentino, Danilo S. Carvalho, André Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究机构) Cancer Biomarker Centre, CRUK Manchester Institute(CRUK曼彻斯特研究所癌症生物标记中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08457 2025-10-10 cs.CL 79%

ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping

Shuang Chen, Yue Guo, Yimeng Ye, Shijue Huang, Wenbo Hu, Haoxi Li, Manyuan Zhang, Jiayu Chen, Song Guo, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The Hong Kong University of Science and Technology(香港科技大学) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏