Self-Improving Large Language Models via Progressive Experience Evolution
基于渐进式经验演化的自我改进大语言模型
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出统一后训练框架SPEE,通过显式经验演化与隐式策略优化结合,在五种数学推理基准上提升了大语言模型的自我改进能力,优于现有基线方法。
Comments 10 pages, 5 figures