arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2604.06268 2026-04-09 cs.LG 85%

RAGEN-2: Reasoning Collapse in Agentic RL

RAGEN-2:代理强化学习中的推理崩溃

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi Chen, Linjie Li, Zhengyuan Yang, Pingyue Zhang, Yiping Lu, Jiajun Wu, Li Fei-Fei, Lijuan Wang, Yejin Choi, Manling Li

机构 * Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent(独立研究者) Imperial College London(伦敦帝国学院) Oxford University(牛津大学) University of Washington(华盛顿大学) Microsoft(微软) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06636 2026-04-09 cs.LG cs.AI cs.CL 85%

SHAPE: Stage-aware Hierarchical Advantage via Potential Estimation for LLM Reasoning

SHAPE:基于潜在估计的阶段感知分层优势用于大语言模型推理

Zhengyang Ai, Zikang Shan, Xiaodong Ai, Jingxian Tang, Hangkai Hu, Pinyan Lu

机构 * Huawei Taylor Lab(华为泰勒实验室) Center for Data Science, Peking University(北京大学数据科学中心) Shanghai University of Finance and Economics(上海财经大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SHAPE通过潜在估计引入分层信用分配机制,提升大语言模型推理的效率与准确性,实验显示在数学推理任务中平均准确率提升3%,token消耗减少30%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06695 2026-04-09 cs.AI 79%

Reasoning Fails Where Step Flow Breaks

推理在步骤流断裂处失效

Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州大学) Jilin University(吉林大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究提出StepFlow方法,通过修复信息流提升多步骤数学、科学和编码任务的推理准确性,揭示了浅层锁定和深层衰减两种信息流失效模式。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 70%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18018 2026-04-09 cs.AI cs.LG 62%

Lost in Cultural Translation: Do LLMs Struggle with Math Across Cultural Contexts?

文化翻译中迷失:大语言模型在不同文化背景下进行数学推理的能力如何?

Aabid Karim, Abdul Karim, Bhoomika Lohana, Matt Keon, Jaswinder Singh, Abdul Sattar

机构 * mV Research Lab(55mV研究实验室) Microsoft(微软) Millcrest Technology(Millcrest科技) Griffith University(格里菲斯大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型在不同文化背景下处理数学问题时存在性能下降,文化适应影响推理模式,需更多多样化的训练数据以提升全球适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 57%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏