arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-19 至 2026-08-19 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2608.17301 2026-08-19 cs.AI 新提交 85%

SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning

SignalReasoner:评估3B模型在信号数学推理任务中的上限

Guozheng Sun

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本研究针对信号数学推理任务,以Qwen2.5-3B-Base为对象,对比两种训练范式与三种强化优化算法,其最佳模型准确率较基准提升超两倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24472 2026-08-19 cs.CL cs.LG 版本更新 81%

Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?

为什么自蒸馏(有时)会降低大语言模型的推理能力?

Jeonghye Kim, Xufang Luo, Minbeom Kim, Sangmook Lee, Dohyung Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国成均馆大学) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自蒸馏在数学推理中降低大语言模型推理能力的原因,发现其通过抑制模型在推理过程中的不确定性表达,导致在未见过的问题上表现下降,强调了适当表达不确定性对鲁棒推理的重要性。

Comments Accepted to COLM 2026. Code is available at this https URL (https://github.com/beanie00/self-distillation-analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-19 cs.CL cs.AI 版本更新 62%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16977 2026-08-19 cs.AI math.CO 新提交 57%

The Problem Is the Problem: Towards Scalable Mathematical Discovery

问题本身才是问题:迈向可扩展的数学发现

Zeyu Zheng, Shengtong Zhang, Jeremy Avigad, Prasad Tetali, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) Anysphere Co.(Anysphere公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出人机协作的FAR流程,从文献中筛选数学问题并聚焦成果,在组合数学试点中筛选出77个待评审成果,验证了其数学发现的有效性。

Comments Code available at this https URL (https://github.com/zeyu-zheng/FAR)

详情

展开后加载摘要…

URL PDF HTML 收藏