Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios
评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Independent Researcher, China(独立研究者,中国) ; Singapore Management University, Singapore(新加坡管理大学)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。
Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench