arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-19 至 2026-03-19 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 1 篇

2510.04072 2026-03-19 cs.LG cs.AI cs.CL stat.ML 85%

Slow-Fast Policy Optimization: Reposition-Before-Update for LLM Reasoning

慢-快策略优化:在更新前重新定位用于大语言模型推理

Ziyan Wang, Zheng Wang, Xingwei Qu, Qi Cheng, Jie Fu, Shengpu Tang, Minjia Zhang, Xiaoming Huo

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Manchester(曼彻斯特大学) NVIDIA Independent(独立) Emory University(埃默里大学)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出慢-快策略优化框架,通过分解步骤为三个阶段,解决RL在早期训练中的稳定性与效率问题,实验表明其在推理任务中提升稳定性、减少rollouts数量并加速收敛。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏