Reward-Aware Population Scaling of Evolutionary Strategies in LLM Fine-Tuning
语言模型微调中基于奖励感知的进化策略种群规模缩放
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究在大语言模型微调中,进化策略种群规模缩放与奖励设计及归一化的关系。通过实验发现交叉熵与二元奖励微调种群规模结论差异大,主要因奖励设计和归一化,禁用归一化可改进小种群模型表现,揭示小种群失败可能是实现问题而非内在限制。
Comments 15 pages, 2 figures. Accepted at the 4th HiLD (High-dimensional Learning Dynamics) Workshop, ICML 2026