WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics
WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。