arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3208 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3208 篇

2503.14891 2025-03-20 cs.CL cs.AI 86%

MetaLadder: Ascending Mathematical Solution Quality via Analogical-Problem Reasoning Transfer

Honglin Lin, Zhuoshi Pan, Yu Li, Qizhi Pei, Xin Gao, Mengzhang Cai, Conghui He, Lijun Wu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06765 2025-03-11 cs.CL cs.AI 86%

Effectiveness of Zero-shot-CoT in Japanese Prompts

Shusuke Takayama, Ian Frank

专题命中 数学推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments NLP2025 Workshop on Japanese Language Resources (JLR2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19622 2025-03-06 cs.CL cs.AI 86%

Weaker LLMs' Opinions Also Matter: Mixture of Opinions Enhances LLM's Mathematical Reasoning

Yanan Chen, Ali Pesaranghader, Tanmana Sadhu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 figure, 3 tables, 4 prompt/data templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19613 2025-02-28 cs.AI cs.LG 86%

Self-rewarding correction for mathematical reasoning

Wei Xiong, Hanning Zhang, Chenlu Ye, Lichang Chen, Nan Jiang, Tong Zhang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02152 2025-01-07 cs.AI cs.CL 86%

Table as Thought: Exploring Structured Thoughts in LLM Reasoning

Zhenjie Sun, Naihao Deng, Haofei Yu, Jiaxuan You

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18415 2024-12-25 cs.CL cs.AI 86%

Multilingual Mathematical Reasoning: Advancing Open-Source LLMs in Hindi and English

Avinash Anand, Kritarth Prasad, Chhavi Kirtani, Ashwin R Nair, Manvendra Kumar Nema, Raj Jaiswal, Rajiv Ratn Shah

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15177 2024-12-20 cs.AI cs.CL 86%

Critical-Questions-of-Thought: Steering LLM reasoning with Argumentative Querying

Federico Castagna, Isabel Sassoon, Simon Parsons

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11664 2024-12-17 cs.CL cs.LG 86%

C3oT: Generating Shorter Chain-of-Thought without Compromising Effectiveness

Yu Kang, Xianghui Sun, Liangyu Chen, Wei Zou

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06592 2024-12-13 cs.CL cs.LG 86%

Improve Mathematical Reasoning in Language Models by Automated Process Supervision

Liangchen Luo, Yinxiao Liu, Rosanne Liu, Samrat Phatale, Meiqi Guo, Harsh Lara, Yunxuan Li, Lei Shu, Yun Zhu, Lei Meng, Jiao Sun, Abhinav Rastogi

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments 17 pages, 5 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10167 2024-10-11 cs.CL cs.AI 86%

Key-Point-Driven Mathematical Reasoning Distillation of Large Language Model

Xunyu Zhu, Jian Li, Can Ma, Weiping Wang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Major Updates:1.fix faults in the error analysis, 2. improve our method, 3. use ChatGPT as teacher LLMs to ensure fairness in performance comparisons

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05318 2024-10-10 cs.LG cs.AI 86%

Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification

Zhenwen Liang, Ye Liu, Tong Niu, Xiangliang Zhang, Yingbo Zhou, Semih Yavuz

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09797 2024-10-08 cs.CL cs.LG 86%

Progressive-Hint Prompting Improves Reasoning in Large Language Models

Chuanyang Zheng, Zhengying Liu, Enze Xie, Zhenguo Li, Yu Li

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICML AI4MATH 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03887 2024-10-03 cs.CL cs.AI 86%

SAAS: Solving Ability Amplification Strategy for Enhanced Mathematical Reasoning in Large Language Models

Hyeonwoo Kim, Gyoungjin Gim, Yungi Kim, Jihoo Kim, Byungju Kim, Wonseok Lee, Chanjun Park

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04906 2024-08-12 cs.CL cs.AI 86%

Towards a Generative Approach for Emotion Detection and Reasoning

Ankita Bhaumik, Tomek Strzalkowski

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11864 2024-08-02 cs.CL cs.AI 86%

Distilling Mathematical Reasoning Capabilities into Small Language Models

Xunyu Zhu, Jian Li, Yong Liu, Can Ma, Weiping Wang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Neural Networks

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.11596 2024-02-27 cs.CL cs.AI 86%

ThoughtSource: A central hub for large language model reasoning data

Simon Ott, Konstantin Hebenstreit, Valentin Liévin, Christoffer Egeberg Hother, Milad Moradi, Maximilian Mayrhauser, Robert Praas, Ole Winther, Matthias Samwald

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Revision: added datasets, formatting

Journal ref Scientific Data 10, 528 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08901 2024-02-16 cs.CL cs.AI 86%

Fewer is More: Boosting LLM Reasoning with Reinforced Context Pruning

Xijie Huang, Li Lyna Zhang, Kwang-Ting Cheng, Fan Yang, Mao Yang

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05074 2023-10-24 cs.CL cs.AI 86%

DialCoT Meets PPO: Decomposing and Exploring Reasoning Paths in Smaller Language Models

Chengcheng Han, Xiaowei Du, Che Zhang, Yixin Lian, Xiang Li, Ming Gao, Baoyuan Wang

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13078 2023-10-12 cs.AI cs.LG cs.PL 86%

LPML: LLM-Prompting Markup Language for Mathematical Reasoning

Ryutaro Yamauchi, Sho Sonoda, Akiyoshi Sannai, Wataru Kumagai

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.05398 2023-03-10 cs.CL cs.AI 86%

MathPrompter: Mathematical Reasoning using Large Language Models

Shima Imani, Liang Du, Harsh Shrivastava

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07604 2025-09-16 cs.LG 86%

K2-Think: A Parameter-Efficient Reasoning System

Zhoujun Cheng, Richard Fan, Shibo Hao, Taylor W. Killian, Haonan Li, Suqi Sun, Hector Ren, Alexander Moreno, Daqian Zhang, Tianjun Zhong, Yuxin Xiong, Yuanzhe Hu, Yutao Xie, Xudong Han, Yuqi Wang, Varad Pimpalkhute, Yonghao Zhuang, Aaryamonvikram Singh, Xuezhi Liang, Anze Xie, Jianshu She, Desai Fan, Chengqian Gao, Liqun Ma, Mikhail Yurochkin, John Maggs, Xuezhe Ma, Guowei He, Zhiting Hu, Zhengzhong Liu, Eric P. Xing

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(基础模型研究所,穆罕默德·本·扎耶德人工智能大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.LG

Comments To access the K2-Think reasoning system, please visit www.k2think.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01221 2026-06-18 cs.MA 版本更新 86%

Epistemic Gain, Aleatoric Cost: Uncertainty Decomposition in Multi-Agent Debate for Math Reasoning

认知增益,偶然成本:多智能体辩论中的不确定性分解用于数学推理

Dan Qiao, Binbin Chen, Fengyu Cai, Jianlong Chen, Wenhao Li, Fuxin Jiang, Zuzhi Chen, Hongyuan Zha, Tieying Zhang, Baoxiang Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title)

AI总结 本文提出贝叶斯不确定性分析框架,将多智能体辩论中的预测不确定性分解为认知不确定性和偶然不确定性,并设计不确定性引导的多智能体强化学习算法,在控制偶然成本的同时提升认知增益,从而提高推理准确性和辩论效率。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17995 2026-04-15 cs.CL cs.AI cs.LG 86%

Variation in Verification: Understanding Verification Dynamics in Large Language Models

验证的多样性:理解大型语言模型中的验证动态

Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Dartmouth College(达特茅斯学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 研究大型语言模型中验证动态,分析问题难度、生成器能力及验证器生成能力三个维度,发现验证有效性与问题难度相关,优化TTS应用中的基本验证策略。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03475 2026-03-05 cs.LG cs.AI cs.CL 86%

When Shallow Wins: Silent Failures and the Depth-Accuracy Paradox in Latent Reasoning

浅层胜出:潜在推理中的沉默失败与深度-准确性悖论

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Independent(独立研究者) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊生成AI创新中心,亚马逊网络服务) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北ern大学,西雅图,华盛顿州,美国)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示数学推理模型在深度增加时准确率无提升,且存在大量不可靠推理路径,需改革评估方法以衡量稳定性。

Comments Accepted at ICLR 2026 Workshop on Latent & Implicit Thinking - Going Beyond CoT Reasoning. 19 Pages and 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06009 2025-08-11 cs.CV 86%

MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models

Jun Feng, Zixin Wang, Zhentao Zhang, Yue Guo, Zhihan Zhou, Xiuyi Chen, Zhenyang Li, Dawei Yin

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title)

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19358 2026-07-23 cs.AI 新提交 85%

LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning

LISA:用于高效长上下文推理的线性索引稀疏注意力

Yu Zhao, Zekun Zhang, Fan Jiang, Bo Zeng, Linlong Xu, Shimin Shan, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对长思维链推理模型中标准自注意力计算复杂度高的问题,提出LISA模块,它集成线性注意力模块和闪电索引器,经两阶段训练,能降低推理复杂度,在特定模型上实现推理加速并提升性能。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15736 2026-07-20 cs.CL 新提交 85%

Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning

更好的开始,更好的结束:用于压缩推理的自引导迭代自推理蒸馏

Leichao Dong, Dongxu Zhang, Yiding Sun, Qirui Wang, Yuhan Wang, Lin Chen, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究大型推理模型冗余计算问题,提出BIRD两阶段自推理蒸馏方法,先在简洁指令下采样简洁解并学习,再用简洁自教师进行策略内蒸馏,在Qwen3系列模型上提升精度并降低响应长度,凸显前缀支持对高效推理蒸馏的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13248 2026-07-16 cs.CL 新提交 85%

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

机构 * Southeast University(东南大学) Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01571 2026-07-03 cs.LG 新提交 85%

Geometric Signatures of Reasoning: A Spectral Perspective on Task Hardness

推理的几何特征:任务难度的谱视角

Aria Masoomi, Mahsa Bazzaz, Adel Javanmard, Vahab Mirrokni

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Google Research(谷歌研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 通过分析Transformer隐藏状态空间中思维链轨迹的谱、位置和运动学几何特征,提出有效维度d_ρ衡量轨迹复杂度,发现平坦特征谱对应更难任务,并利用运动学特征在生成早期预测答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11164 2026-06-10 cs.AI 新提交 85%

ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models

ReasonAlloc: 推理模型的分层解码时KV缓存预算分配

Wenhao Liu, Hao Shi, Yunhe Li, Weizhi Fei, Xiangyuan Wang, Mengzhe Ruan, Hanxu Hou, Peisong Wang, Linqi Song, Shuang Qiu

机构 * Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Shenzhen University of Advanced Technology(深圳理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对长链式推理中KV缓存快速增长导致的推理瓶颈,提出ReasonAlloc框架,通过离线层预分配和在线头重分配的分层预算分配策略,在不增加训练开销下显著提升小预算下的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏