HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
HarnessOpt-Bench:评估大型语言模型的 harness 优化能力
机构 * Scale AI
AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。
大厂专区
HarnessOpt-Bench:评估大型语言模型的 harness 优化能力
机构 * Scale AI
AI总结 本研究提出HarnessOpt-Bench基准,评估前沿LLM在高成本随机评估下的端到端harness优化能力,发现优化器模型差异大于编码harness、原生harness非始终更优,该能力具可测性与提升空间。