SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring
SWE-Bench ProMax:面向大规模多语言代码重构的智能体基准测试
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL
AI总结 该研究推出SWE-Bench ProMax多语言代码重构基准,含170个跨7种语言的大规模重构任务,经严格筛选后前沿模型仅达41.2%解决率,为AI编码智能体提供挑战性测试。
Comments Published as a conference paper at COLM 2026