LLMZero: Discovering Adaptive Training Strategies for RL Post-Training via LLM Agents
LLMZero: 通过LLM智能体发现RL后训练的自适应训练策略
机构 * Amazon(亚马逊)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出LLMZero系统,利用LLM智能体通过树搜索发现多阶段RL后训练的自适应策略,揭示容量参数单调累积、正则化参数振荡的规律,在4个GRPO任务上相对基线提升9%-140%。