Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
批量上下文强化:一种任务扩展定律以实现高效推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学)
AI总结 本文提出批量上下文强化方法,通过在共享上下文窗口中同时解决多个问题,实现高效推理,减少token消耗并提升准确性。
Comments 43 pages, 5 figures, 24 tables