BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services
BackendForge:使用后端服务对智能端到端代码生成进行基准测试
机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) ; SCS, Peking University(北京通明湖信息技术应用创新中心) ; Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) ; Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) ; Shanghai Institute of Systems for Open Computing
专题命中 工具调用 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE
AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。