Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training
匹配精度,不同几何:进化策略与GRPO在LLM后训练中的比较
机构 * University of Miami(迈阿密大学) ; Kempner Institute, Harvard University(哈佛大学肯普纳研究所) ; Harvard University(哈佛大学)
专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);分类 cs.LG;language model(comments)
AI总结 本文比较了进化策略(ES)与组相对策略优化(GRPO)在单任务和连续学习设置中的表现,发现ES在单任务精度上可与GRPO匹配,但两者在参数空间更新上存在显著差异,且ES在弱信息方向上能积累较大偏移,同时保持任务性能。
Comments Accepted to Conference on Language Modeling (COLM) 2026