arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2508.14828 2026-03-24 cs.CL cs.AI cs.LG 89%

Long Chain-of-Thought Reasoning Across Languages

跨语言的长链式推理

Josh Barua, Seun Eisape, Kayo Yin, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了跨语言长链式推理能力的扩展机制,发现模型规模扩展提升En-CoT性能,但Target-CoT表现滞后,尤其在数学推理中更为明显。通过预训练和后训练优化,多语言模型在推理效率和稳定性上取得进展,同时揭示了语言特定的失败模式。

Comments Accepted to ICLR 2026. v1 is a workshop version accepted to SCALR @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27419 2026-03-24 cs.AI cs.CL 86%

DeepCompress: A Dual Reward Strategy for Dynamically Exploring and Compressing Reasoning Chains

DeepCompress:一种双奖励策略用于动态探索和压缩推理链

Tian Liang, Wenxiang Jiao, Zhiwei He, Jiahao Xu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13170 2026-03-24 cs.CL 85%

Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism

戴上思考帽子:从人类推理机制视角对链式思考微调的综述

Xiaoshu Chen, Sihang Zhou, Ke Liang, Duanyang Yuan, Haoyuan Chen, Xiaoyu Sun, Lingyuan Meng, Xinwang Liu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);planning(abstract);分类 cs.CL

AI总结 本文从人类推理机制角度综述了链式思考微调,分析其通过六顶思考帽子框架分类方法,并探讨未来研究方向及现有数据集与模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01037 2026-03-24 cs.LG cs.AI 84%

CurES: From Gradient Analysis to Efficient Curriculum Learning for Reasoning LLMs

CurES:从梯度分析到高效课程学习以提升推理大语言模型

Yongcheng Zeng, Zexu Sun, Bokai Ji, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Haifeng Zhang, Xu Chen, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Baidu Inc.(百度公司) University College London(伦敦大学学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CurES方法,通过梯度优化理论分析,改进大语言模型推理任务的训练效率,实验显示其在多个数学推理基准上优于现有方法。

Comments 25 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15340 2026-03-24 cs.LG 79%

SSR: Speculative Parallel Scaling Reasoning in Test-time

SSR:测试时的推测并行扩展推理

Yuanlin Chu, Bo Wang, Xiang Liu, Hong Chen, Aiwei Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 SSR提出一种无需训练的框架,通过引入分步推测解码加速推理而不牺牲正确性,提升数学推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22206 2026-03-24 cs.LG 70%

Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs

Chimera:面向异构大语言模型的延迟与性能感知多智能体服务

Kangqi Ni, Wenyue Hua, Xiaoxiang Shi, Jiang Guo, Shiyu Chang, Tianlong Chen

机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 Chimera通过语义路由和预测调度优化多智能体工作流服务,提升端到端延迟与任务性能,减少1.2-2.4倍延迟并提高8.0-9.5个百分点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21475 2026-03-24 cs.AI 70%

Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systems

统一-MAS:通用领域节点生成以增强自动多智能体系统

Hehai Lin, Yu Yan, Zixuan Wang, Bo Xu, Sudong Wang, Weiquan Huang, Ruochen Zhao, Minzhi Li, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究院(I2R),A*STAR)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出统一-MAS,通过离线节点合成解耦细粒度节点实现与拓扑编排,提升多智能体系统在知识密集型领域的性能与成本效益。

Comments Code is available at https://github.com/linhh29/Unified-MAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02833 2026-03-24 cs.LG 70%

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

TIC-GRPO:基于人类反馈的强化学习优化的可证明和高效方法

Lei Pang, Jun Luo, Ruinan Jin

机构 * Peking University, Beijing, China(北京大学) The Ohio State University, Columbus, USA(俄亥俄州立大学) Shugu Yuntai Technology Co., Ltd.(舒guard云泰科技有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出TIC-GRPO算法,通过改进重要性采样方法,提升GRPO在人类反馈强化学习中的性能与收敛速度。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21177 2026-03-24 cs.LG cs.AI 62%

Prompt replay: speeding up grpo with on-policy reuse of high-signal prompts

提示重放:通过在线重用高信号提示加速GRPO

Andrei Baroian, Rutger Berger

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Prompt Replay方法,通过在线重用高信号提示提升GRPO训练效率,减少无效提示,提高平均绝对优势,并加快初始准确率提升,但存在过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21574 2026-03-24 cs.AI 57%

Adaptive Robust Estimator for Multi-Agent Reinforcement Learning

自适应稳健估计器用于多智能体强化学习

Zhongyi Li, Wan Tian, Jingyu Chen, Kangyao Huang, Huiming Zhang, Hui Yang, Tao Ren, Jinyang Jiang, Yijie Peng, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北京理工大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自适应稳健估计器和双智能体回答-批判-重写框架,解决多智能体协作中的信用分配和奖励噪声问题,提升训练稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12275 2026-03-24 cs.CL 57%

On-Policy Context Distillation for Language Models

在线策略上下文蒸馏用于语言模型

Tianzhu Ye, Li Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在线策略上下文蒸馏框架,通过训练学生模型在生成轨迹的同时最小化逆Kullback-Leibler散度,提升模型在数学推理、文本游戏等任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 57%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏