arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3220 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2504.03846 2025-12-16 cs.CL 70%

Do LLM Evaluators Prefer Themselves for a Reason?

大语言模型评估器为何偏好自己?

Wei-Lin Chen, Zhepei Wei, Xinyu Zhu, Shi Feng, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) George Washington University(乔治华盛顿大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在评估时自我偏好现象的成因,发现更强模型更倾向于偏好自身输出,但其中大部分偏好源于客观质量优势,同时提出通过扩展策略可减少有害自我偏好。

Comments Added LMArena experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12429 2025-11-18 cs.LG 70%

Tailored Primitive Initialization is the Secret Key to Reinforcement Learning

Yihang Yao, Guangtao Zeng, Raina Wu, Yang Zhang, Ding Zhao, Zhang-Wei Hong, Chuang Gan

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00183 2025-11-06 cs.LG 70%

PDE-SHARP: PDE Solver Hybrids through Analysis and Refinement Passes

Shaghayegh Fazliani, Madeleine Udell

机构 * Department of Mathematics Stanford University(数学系 斯坦福大学) Department of Management Science & Engineering Stanford University(管理科学与工程系 斯坦福大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01190 2025-11-04 cs.LG stat.ML 70%

Analyzing the Power of Chain of Thought through Memorization Capabilities

Lijia Yu, Xiao-Shan Gao, Lijun Zhang

机构 * Institute of AI for Industries(人工智能产业研究院) State Key Laboratory of Mathematical Sciences(数学科学国家重点实验室) Academy of Mathematics and Systems Science(数学与系统科学学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of System Software of Chinese Academy of Sciences(中国科学院系统软件重点实验室)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12872 2025-11-04 cs.MA cs.AI stat.ML 70%

KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems

Hancheng Ye, Zhengqi Gao, Mingyuan Ma, Qinsi Wang, Yuzhe Fu, Ming-Yu Chung, Yueqian Lin, Zhijian Liu, Jianyi Zhang, Danyang Zhuo, Yiran Chen

机构 * Duke University(杜克大学) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

Comments Accepted for publication in NeurIPS2025. Code is available at \url{https://github.com/FastMAS/KVCOMM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27355 2025-11-03 cs.CL 70%

ThoughtProbe: Classifier-Guided LLM Thought Space Exploration via Probing Representations

Zijian Wang, Chang Xu

机构 * School of Computer Science(计算机科学学院) The University of Sydney(悉尼大学)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24397 2025-10-29 cs.AI 70%

APTBench: Benchmarking Agentic Potential of Base LLMs During Pre-Training

Jiarui Qin, Yunjia Xi, Junjie Huang, Renting Rui, Di Yin, Weiwen Liu, Yong Yu, Weinan Zhang, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19339 2025-10-23 cs.CV cs.CL 70%

PixelWorld: How Far Are We from Perceiving Everything as Pixels?

Zhiheng Lyu, Xueguang Ma, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Vector Institute, Toronto(多伦多向量研究所)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17715 2025-10-21 cs.CL 70%

QueST: Incentivizing LLMs to Generate Difficult Problems

Hanxu Hu, Xingxing Zhang, Jannis Vamvas, Rico Sennrich, Furu Wei

机构 * University of Zurich(苏黎世大学) Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06917 2025-10-21 cs.CL eess.AS 70%

SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models

Cheng-Han Chiang, Xiaofei Wang, Linjie Li, Chung-Ching Lin, Kevin Lin, Shujie Liu, Zhendong Wang, Zhengyuan Yang, Hung-yi Lee, Lijuan Wang

机构 * National Taiwan University(台湾大学) Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06652 2025-10-09 cs.CL 70%

Aligning Large Language Models via Fully Self-Synthetic Data

Shangjian Yin, Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Yu Meng

机构 * University of California, Riverside(加州大学河滨分校) University of Virginia(弗吉尼亚大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18189 2025-09-24 cs.CV cs.AI 70%

Qianfan-VL: Domain-Enhanced Universal Vision-Language Models

Daxiang Dong, Mingming Zheng, Dong Xu, Bairong Zhuang, Wenyu Zhang, Chunhua Luo, Haoran Wang, Zijian Zhao, Jie Li, Yuxuan Li, Hanjun Zhong, Mengyue Liu, Jieting Chen, Shupeng Li, Lun Tian, Yaping Feng, Xin Li, Donggang Jiang, Yong Chen, Yehua Xu, Duohao Qin, Chen Feng, Dan Wang, Henghua Zhang, Jingjing Ha, Jinhui He, Yanfeng Zhai, Chengxin Zheng, Jiayi Mao, Jiacheng Chen, Ruchang Yao, Ziye Yuan, Jianmin Wu, Guangjun Xie, Dou Shen

机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11930 2025-09-23 cs.CL 70%

Feedback Friction: LLMs Struggle to Fully Incorporate External Feedback

Dongwei Jiang, Alvin Zhang, Andrew Wang, Nicholas Andrews, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08910 2025-09-12 cs.CV cs.AI 70%

PromptGuard: An Orchestrated Prompting Framework for Principled Synthetic Text Generation for Vulnerable Populations using LLMs with Enhanced Safety, Fairness, and Controllability

Tung Vu, Lam Nguyen, Quynh Dao

机构 * Posts and Telecommunications Institute of Technology(邮电技术研究所) Hanoi Architectural University(河内建筑大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08780 2025-09-09 cs.CL 70%

Large Language Models Might Not Care What You Are Saying: Prompt Format Beats Descriptions

Chenming Tang, Zhixiang Wang, Hao Sun, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) MOE Key Laboratory of Computational Linguistics, Peking University School of Computer Science, Peking University(教育部计算语言学重点实验室,北京大学计算机科学学院,北京大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Findings. 23 pages, 23 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00125 2025-09-03 cs.AI 70%

Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning

Ang Li, Zhihang Yuan, Yang Zhang, Shouda Liu, Yisen Wang

机构 * PKU(北京大学) ByteDance Seed(字节跳动种子)

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07124 2025-08-11 cs.CL 70%

Structural Reformation of Large Language Model Neuron Encapsulation for Divergent Information Aggregation

Denis Bakushev, Gideon Boultinghouse, Harriet Oppenheimer, Sebastian Gillingwater, Valentina Ashington, Wilfred Stanborough

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments arXiv admin note: This paper has been withdrawn by arXiv due to disputed and unverifiable authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04094 2025-08-08 cs.CL 70%

BloomWise: Enhancing Problem-Solving capabilities of Large Language Models using Bloom's-Taxonomy-Inspired Prompts

Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos, Alexandros Potamianos

机构 * Speech and Language Processing Group, National Technical University of Athens(国家技术大学雅典语音与语言处理组) Institute for Language and Speech Processing, Athena Research Center(雅典研究中心语言与语音处理研究所) National Technical University of Athens(国家技术大学雅典)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03500 2025-08-06 cs.AI 70%

Error Detection and Correction for Interpretable Mathematics in Large Language Models

Yijin Yang, Cristina Cornelio, Mario Leiva, Paulo Shakarian

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02076 2025-08-05 cs.AI cs.GT 70%

Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games

Yunhao Liang, Yuan Qu, Jingyuan Yang, Shaochong Lin, Zuo-Jun Max Shen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12079 2025-07-17 cs.CL 70%

Findings of MEGA: Maths Explanation with LLMs using the Socratic Method for Active Learning

Tosin Adewumi, Foteini Simistira Liwicki, Marcus Liwicki, Viktor Gardelli, Lama Alkhaled, Hamam Mokayed

机构 * Department of Electrical and Computer Engineering, Michigan State University(密歇根州立大学电气与计算机工程系)

专题命中 数学推理 :reasoning(abstract);CoT(abstract);分类 cs.CL

Comments This paper was accepted for the special issue AI for Education by the IEEE Signal Processing Magazine journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02173 2025-07-04 cs.AI 70%

Data Diversification Methods In Alignment Enhance Math Performance In LLMs

Berkan Dokmeci, Qingyang Wu, Ben Athiwaratkun, Ce Zhang, Shuaiwen Leon Song, James Zou

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Together AI University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20170 2025-07-02 cs.AI 70%

Program of Equations Thoughts to Solve Algebra Word Problems

Yunze Lin

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Withdrawn pending institutional authorization and core revisions to address methodological inconsistencies in Sections 3-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00309 2025-07-01 cs.AI 70%

Evaluation of LLMs for mathematical problem solving

Ruonan Wang, Runxi Wang, Yunwen Shen, Chengfeng Wu, Qinglin Zhou, Rohitash Chandra

机构 * Transitional Artificial Intelligence Research Group, School of Mathematics and Statistics, UNSW Sydney, Sydney, Australia(过渡人工智能研究组,数学与统计学学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19171 2025-06-25 cs.LG 70%

Distilling Tool Knowledge into Language Models via Back-Translated Traces

Xingyue Huang, Xianglong Hu, Zifeng Ding, Yuan He, Rishabh, Waleed Alzarooni, Ziyu Ye, Wendong Fan, Bailan He, Haige Bo, Changran Hu, Guohao Li

机构 * University of Oxford(牛津大学) Amazon(亚马逊公司) University of Cambridge(剑桥大学) University of Los Angeles(洛杉矶大学) University of Chicago(芝加哥大学) Ludwig Maximilian University of Munich(慕尼黑莱布尼茨大学)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted in Workshop in Multi-Agent Systems in the Era of Foundation Models: Opportunities, Challenges and Futures, ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16787 2025-06-23 cs.LG 70%

Revisiting LoRA through the Lens of Parameter Redundancy: Spectral Encoding Helps

Jiashun Cheng, Aochuan Chen, Nuo Chen, Ziqi Gao, Yuhan Li, Jia Li, Fugee Tsung

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

Comments 18 pages; Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04108 2025-06-06 cs.CL 70%

Rectified Sparse Attention

Yutao Sun, Tianzhu Ye, Li Dong, Yuqing Xia, Jian Chen, Yizhao Gao, Shijie Cao, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19346 2025-06-03 cs.CL 70%

Large Language Models Struggle with Unreasonability in Math Problems

Jingyuan Ma, Damai Dai, Zihang Yuan, Rui li, Weilin Luo, Bin Wang, Qun Liu, Lei Sha, Zhifang Sui

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Institute of Artificial Intelligence, Beihang University(人工智能学院,北航) Huawei Noah’s Ark Lab, China(华为诺亚实验室,中国)

专题命中 数学推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24354 2025-06-02 cs.CL 70%

Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research

Qianqian Zhang, Jiajia Liao, Heting Ying, Yibo Ma, Haozhan Shen, Jingcheng Li, Peng Liu, Lu Zhang, Chunxin Fang, Kyusong Lee, Ruochen Xu, Tiancheng Zhao

机构 * Om AI Research(Om AI研究机构) Binjiang Institute of Zhejiang University(浙江大学滨江学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21398 2025-05-28 cs.AI cs.ET 70%

A Structured Unplugged Approach for Foundational AI Literacy in Primary Education

Maria Cristina Carrisi, Mirko Marras, Sara Vergallo

机构 * University of Cagliari(卡利亚里大学) University of Macerata(马切拉塔大学)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏