arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-20 至 2026-03-20 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2603.18886 2026-03-20 cs.AI cs.CL 84%

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

数学对象推理:在线奖励建模与测试时间聚合

Pranjal Aggarwal, Marjan Ghazvininejad, Seungone Kim, Ilia Kulikov, Jack Lanchantin, Xian Li, Tianjian Li, Bo Liu, Graham Neubig, Anaelia Ovalle, Swarnadeep Saha, Sainbayar Sukhbaatar, Sean Welleck, Jason Weston, Chenxi Whitehouse, Adina Williams, Jing Xu, Ping Yu, Weizhe Yuan, Jingyu Zhang, Wenting Zhao

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 数学推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16060 2026-03-20 cs.AI 79%

ARISE: Agent Reasoning with Intrinsic Skill Evolution in Hierarchical Reinforcement Learning

ARISE: 在分层强化学习中通过内在技能进化实现智能体推理

Yu Li, Rui Miao, Zhengling Qi, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Mathematical Sciences, University of Texas at Dallas(德克萨斯大学达拉斯分校数学科学系) School of Business, George Washington University(乔治华盛顿大学商学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ARISE提出一种分层强化学习框架,通过共享策略管理高阶技能和生成低阶响应,提升数学推理能力,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18756 2026-03-20 cs.LG cs.AI cs.CL 67%

Are complicated loss functions necessary for teaching LLMs to reason?

复杂损失函数是否必要用于教LLM进行推理?

Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 67%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏