Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies
超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cognizant AI Lab(高知特人工智能实验室)
AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。