arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-30 至 2026-03-30 共收录 1 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1 篇

2512.13607 2026-03-30 cs.CL cs.AI cs.LG 82%

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏