Apriel-1.5-OpenReasoner: RL Post-Training for General-Purpose and Efficient Reasoning
阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理
机构 * ServiceNow
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。
Comments 20 pages, 4 tables, 6 figures, appendix included