SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code
SWE-InfraBench:评估语言模型在云基础设施代码上的表现
专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)
AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。
Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle