LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents
LEGO-RL:利用原生强化学习实现编码智能体
机构 * Huawei Technologies Co., Ltd(华为技术有限公司) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。
Comments Webpage: https://lego-rl.pages.dev