arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2508.04755 2025-08-08 cs.LG cs.CE 77%

Are Large Language Models Dynamic Treatment Planners? An In Silico Study from a Prior Knowledge Injection Angle

Zhiyao Luo, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系牛津大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18013 2025-07-30 cs.CL 77%

Technical Report of TeleChat2, TeleChat2.5 and T1

Zihan Wang, Xinzhang Liu, Yitong Yao, Chao Wang, Yu Zhao, Zhihao Yang, Wenmin Deng, Kaipeng Jia, Jiaxin Peng, Yuyao Huang, Sishi Xiong, Zhuo Jiang, Kaidong Yu, Xiaohui Hu, Fubei Yao, Ruiyu Fang, Zhuoru Jiang, Ruiting Song, Qiyi Xie, Rui Xue, Xuewei He, Yanlei Xue, Zhu Yuan, Zhaoxi Zhang, Zilu Huang, Shiquan Wang, Xin Wang, Hanming Wu, Mingyuan Wang, Xufeng Zhan, Yuhan Sun, Zhaohu Xing, Yuhao Jiang, Bingkai Yang, Shuangyong Song, Yongxiang Li, Zhongjiang He, Xuelong Li

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04625 2025-03-10 cs.CL 77%

START: Self-taught Reasoner with Tools

Chengpeng Li, Mingfeng Xue, Zhenru Zhang, Jiaxi Yang, Beichen Zhang, Xiang Wang, Bowen Yu, Binyuan Hui, Junyang Lin, Dayiheng Liu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 38 pages, 5 figures and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16040 2025-02-25 cs.IR cs.CL 77%

Inference Computation Scaling for Feature Augmentation in Recommendation Systems

Weihao Liu, Zhaocheng Du, Haiyuan Zhao, Wenbo Zhang, Xiaoyan Zhao, Gang Wang, Zhenhua Dong, Jun Xu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04057 2025-02-12 cs.CL 77%

Self-Harmonized Chain of Thought

Ziqi Jin, Wei Lu

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12393 2024-09-20 cs.CL 77%

Small Language Models are Equation Reasoners

Bumjun Kim, Kunha Lee, Juyeon Kim, Sangam Lee

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17349 2024-07-25 cs.CL 77%

Boosting Large Language Models with Socratic Method for Conversational Mathematics Teaching

Yuyang Ding, Hanglei Hu, Jie Zhou, Qin Chen, Bo Jiang, Liang He

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);math reasoning(abstract);分类 cs.CL

Comments Accepted By CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12744 2024-03-20 cs.CL 77%

Instructing Large Language Models to Identify and Ignore Irrelevant Conditions

Zhenyu Wu, Chao Shen, Meng Jiang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments NAACL 2024 - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06867 2023-12-13 cs.CL 77%

Get an A in Math: Progressive Rectification Prompting

Zhenyu Wu, Meng Jiang, Chao Shen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments AAAI 2024 - Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14999 2023-11-03 cs.CL 77%

The Art of SOCRATIC QUESTIONING: Recursive Thinking with Large Language Models

Jingyuan Qi, Zhiyang Xu, Ying Shen, Minqian Liu, Di Jin, Qifan Wang, Lifu Huang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments ACL 2023 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05653 2023-10-04 cs.CL 77%

MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning

Xiang Yue, Xingwei Qu, Ge Zhang, Yao Fu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments Work in progress; Xiang Yue and Wenhu Chen contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05077 2026-02-26 cs.CL cs.AI 76%

Slm-mux: Orchestrating small language models for reasoning

Slm-mux: 通过协调小型语言模型进行推理

Chenyu Wang, Zishen Wan, Hao Kang, Emma Chen, Zhiqiang Xie, Tushar Krishna, Vijay Janapa Reddi, Yilun Du

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 SLM-MUX通过协调多个小型语言模型提升推理准确性,实现比单个模型更高的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15260 2026-02-18 cs.LG cs.AI 76%

Fast and Effective On-policy Distillation from Reasoning Prefixes

基于推理前缀的高效在线策略蒸馏

Dongxu Zhang, Zhichao Yang, Sepehr Janghorbani, Jun Han, Andrew Ressler, Qian Qian, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于推理前缀的在线策略蒸馏方法,通过仅对生成输出的前缀应用蒸馏目标并提前终止采样,有效降低训练成本,同时保持与完整OPD相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18702 2026-02-17 cs.LG cs.AI cs.AR 76%

From Fuzzy to Exact: The Halo Architecture for Infinite-Depth Reasoning via Rational Arithmetic

从模糊到精确:通过有理算术的Halo架构实现无限深度推理

Hansheng Ren

机构 * Hansheng Ren(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 Halo架构通过有理算术实现无限深度推理,结合双环拓扑和精确推断单元,提升模型稳定性和效率,实现从模糊到精确的数学框架转型。

Comments Architecture update: Formalizes the Dual-Ring Topology and the Clean Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07412 2024-04-10 cs.CL cs.LG 76%

Advancing Regular Language Reasoning in Linear Recurrent Neural Networks

Ting-Han Fan, Ta-Chung Chi, Alexander I. Rudnicky

专题命中 数学推理 :reasoning(title);分类 cs.CL、cs.LG

Comments Accepted at the 2024 Annual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL 2024). The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
1211.7012 2021-12-03 cs.AI cs.DL cs.LG cs.LO 76%

Learning-Assisted Automated Reasoning with Flyspeck

Cezary Kaliszyk, Josef Urban

专题命中 数学推理 :reasoning(title);分类 cs.AI、cs.LG

Journal ref J. Automated Reasoninig 54(1): 99, 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13607 2026-08-17 cs.AI cs.CL cs.LG 新提交 75%

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

没有通用信号可预测版本更新下的样本级大语言模型退化

Jia Sheng, Yiwei Lu

机构 * University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何用推理时信号预测LLM版本更新导致的样本级退化,对比单模型与跨版本信号,发现信号有效性具任务依赖性且无通用最优信号,部分跨版本信号可支持选择性回退,从业者可据此选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10123 2026-07-14 cs.LG cs.AI cs.CL 版本更新 75%

Nested-ReFT: Efficient Reinforcement Learning for Large Language Model Fine-Tuning via Off-Policy Rollouts

Nested-ReFT:通过离策略展开实现大语言模型微调的高效强化学习

Maxime Heuillet, Yufei Cui, Boxing Chen, Audrey Durand, Prasanna Parthasarathi

机构 * Mila - Québec AI Institute, Canada(魁北克人工智能研究所) Huawei Noah's Ark Lab (Montreal Research Center), Canada(华为诺亚实验室(蒙特利尔研究中心)) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型在数学推理等领域的高级推理难题,提出Nested-ReFT框架,利用离策略展开及动态层跳过降低训练推理成本,经理论与实证分析验证其有效性,还探索偏差缓解变体以维持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02510 2026-07-03 cs.AI cs.CL cs.LG stat.AP stat.ML 新提交 75%

Online Safety Monitoring for LLMs

LLMs的在线安全监控

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 75%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15327 2026-06-09 cs.LG cs.AI cs.CL stat.ML 版本更新 75%

Prescriptive Scaling Reveals the Evolution of Language Model Capabilities

规范性缩放揭示语言模型能力的演变

Hanlin Zhang, Jikai Jin, Vasilis Syrgkanis, Sham Kakade

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过大规模观测评估和分位数回归,提出规范性缩放定律,将预训练计算预算映射到下游准确率,并验证其时间稳定性,引入平衡I-最优采样算法降低评估成本。

Comments ICML 2026 Oral. Blog Post: https://jkjin.com/prescriptive-scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01167 2026-06-02 cs.LG cs.AI cs.CL 75%

Simultaneous Multi-objective Alignment Across Verifiable and Non-verifiable Rewards

同时多目标对齐:可验证与不可验证奖励

Yiran Shen, Yu Xia, Jonathan Chang, Prithviraj Ammanabrolu

机构 * ucsd(加州大学圣地亚哥分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MAHALO框架,通过标准化PRM训练、多动作头DPO和PRM引导解码,实现大语言模型在可验证与不可验证奖励上的多目标对齐,减少目标冲突并支持推理时控制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10201 2026-05-26 cs.LG cs.AI cs.CL 75%

Future-KL Regularized GRPO: Process-Level Credit Assignment from $f$-Divergence Regularization

未来KL正则化GRPO:基于f-散度正则化的过程级信用分配

Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出未来KL正则化策略优化(FRPO),通过因果未来正则化回报修正GRPO中局部KL损失缺失的梯度信号,在数学推理任务中提升pass@16并保持更高熵和更低策略漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19075 2026-05-21 cs.AI cs.CL cs.LG 75%

Universal Reasoner: A Single, Composable Plug-and-Play Reasoner for Frozen LLMs

Universal Reasoner: 一个单一、可组合的即插即用推理器用于冻结的LLM

Jaemin Kim, Hangeol Chang, Hyunmin Hwang, Choonghan Kim, Jong Chul Ye

机构 * Graduate School of Artificial Intelligence, Korea Advanced Institute of Science and Technology(人工智能研究生院,韩国科学技术院)

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Universal Reasoner,一种可组合且即插即用的推理模块,能够在冻结的大规模语言模型上提供专门的推理能力,通过共享或对齐的token空间实现弱到强的泛化,实验表明其在数学推理和机器翻译中优于现有微调方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16826 2026-05-19 cs.LG cs.AI cs.CL 75%

Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation

解耦KL与轨迹:为LLM蒸馏中的SFT、DAgger、离线RL和OPD提供统一视角

Anhao Zhao, Haoran Xin, Yingqi Fan, Junlong Tong, Wenjie Li, Xiaoyu Shen

机构 * Eastern Institute of Technology(东技术院) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能 thrust,香港科学与技术大学(广州))

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了知识蒸馏中KL散度与轨迹之间的耦合问题,通过解耦两个轴向,提出了四种有效的蒸馏目标,并通过实验揭示了KL方向、前缀源和训练长度之间的权衡关系,提出了KL混合和熵门长度课程等实用方法。

Comments Code available at https://github.com/EIT-NLP/Decoupled-Distill

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16342 2026-05-19 cs.LG cs.AI cs.CL 75%

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15464 2026-05-18 cs.LG cs.AI cs.CL 75%

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

GRLO:从零开始在开放环境中的通用强化学习

Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12554 2026-05-15 cs.LG cs.AI cs.CL 75%

Reinforcement Learning for Diffusion LLMs with Entropy-Guided Step Selection and Stepwise Advantages

基于熵引导的步骤选择和分步优势的扩散语言模型强化学习

Vishnu Teja Kunde, Fatemeh Doudi, Mahdi Farahbakhsh, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系)

专题命中 数学推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种针对扩散语言模型的强化学习方法,通过熵引导选择步骤和分步优势估计,实现无偏策略梯度,提升生成效果和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19924 2026-05-15 cs.CL cs.AI cs.LG 75%

OPT-Engine: Benchmarking the Limits of LLMs in Optimization Modeling via Complexity Scaling

OPT-Engine:通过复杂度扩展评估大语言模型在优化建模中的极限

Yitian Chen, Cheng Cheng, Yinan Sun, Zi Ling, Dongdong Ge

机构 * Shanghai University of Finance and Economics(上海财经大学) Booth School of Business, University of Chicago(芝加哥大学商学院) Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过OPT-ENGINE框架评估大语言模型在优化建模中的能力与扩展性,发现纯文本推理在任务复杂度增加时存在鲁棒性差距,外部工具无法满足全局优化约束,指出约束自动建模是当前SOTA范式的瓶颈。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07579 2026-05-12 cs.LG cs.AI cs.CL 75%

Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States

你的语言模型就是其自身的批评者:具有从演员内部状态估计价值的强化学习

Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学) Computer Science and Engineering(计算机科学与工程)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出POISE方法,通过利用策略模型内部信号在强化学习中实现高效的基线估计,减少方差并提高训练稳定性,适用于数学推理任务。

Comments Under Review; Project Page: https://elijah0430.github.io/poise/

详情

展开后加载摘要…

URL PDF HTML 收藏