An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc
面向AI生成科学代码的PETSc代理评估框架
机构 * Argonne National Laboratory(阿贡国家实验室)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI
AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。