IsoCompute Playbook: Optimally Scaling Sampling Compute for LLM RL
IsoCompute Playbook: 优化LLM RL中的采样计算规模
机构 * UC San Diego(UC圣地亚哥大学) ; MBZUAI-IFM ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文研究了LLM RL中采样计算的最优分配,发现并行回放数随计算预算增加而增加并饱和,不同问题驱动机制不同,且增加并行回放可减少干扰,问题数影响训练稳定性。
Comments 29 pages, 27 figures. Under review