Toward Training Superintelligent Software Agents through Self-Play SWE-RL
通过自我对弈SWE-RL训练超级智能软件代理
机构 * Meta FAIR ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta TBD Lab(Meta TBD 实验室) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出自我对弈SWE-RL(SSR)方法,通过强化学习在自对弈环境中训练单一LLM代理,使其在无需人工标注问题或测试的情况下,在真实代码库中迭代注入和修复软件缺陷,在SWE-bench基准上实现显著自我改进并超越人类数据基线。
Comments Accepted to ICML 2026