训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型接口代理收集轨迹。
作者使用约6000个训练样本和论文所称的适中算力,将Qwen3.5-9B在SWE-bench Verified上的成绩从41.8%提高到56.4%,绝对提升14.6个百分点。该结果针对一套完整可复现的编程智能体流程,不代表同样数据量能让所有模型和框架得到相同增益。
训练器不再接管智能体循环
传统智能体强化学习通常由训练引擎发起环境交互、调用模型、执行动作并计算奖励。真实产品里的Agent框架已经负责工具编排、上下文压缩、错误重试和控制流,如果为了训练重写一遍,部署时的行为与训练时很容易不一致。
Agent Lightning把这种设置称为“带框架的智能体强化学习”。Agent框架仍是交互循环的所有者,训练器只看到一系列LLM请求与响应。两者通过兼容的模型端点代理连接,现有Agent不必改写内部工具逻辑。
框架通过API网关、轨迹控制器和定制训练器连接现有Agent运行环境。
这项分离降低了接入门槛,也把新的难题暴露出来。框架可能压缩历史、重新序列化消息或合并多次请求,训练器却需要精确恢复Token、动作概率和奖励归属;如果两侧看到的序列不同,策略梯度更新就会偏离实际采样行为。
约3500行代码处理五类错位
Agent Lightning 1.0的实现约3500行代码,重点处理重分词、样本合并、优势计算、损失归一化与后端调度。模型代理保存原始请求响应,样本适配器再把框架轨迹转换成训练可用格式,避免让业务Agent承担训练专用代码。
论文结构图展示轨迹采集、样本转换、奖励与训练更新之间的数据关系。
框架支持本地与Kubernetes控制器,推理和训练后端可以分别扩展。异步运行提高资源利用率,但也会带来旧策略采样、任务完成时间差异和失败样本处理问题。论文把这些因素放进同一测试床,目的之一是让研究者能复现实验,而不是只给出某个Agent的最终分数。
6000条样本带来14.6个百分点
在编程实验中,团队以Qwen3.5-9B为基础,使用约6000个训练样本完成强化学习。SWE-bench Verified从41.8%升到56.4%。这个基准要求模型在真实代码仓库中定位问题、修改文件并通过测试,分数变化对应完成任务比例的绝对提升。
论文对比训练引擎接管交互与Agent框架保留控制权的两种工作方式。
作者还在指令遵循、搜索和编程Agent上评估框架,证明接口不只服务SWE-bench。论文并未把14.6个百分点归因于单个算法技巧;端点代理、轨迹对齐、奖励处理和训练配置共同构成结果,拆开其中任何环节都需要重新做消融。
实验图用于检查样本处理与训练设置变化对奖励和稳定性的影响。
结果仍受基准边界约束。SWE-bench Verified有固定仓库与测试,生产编程任务还包含权限、依赖下载、长时间构建、私有工具和模糊需求;部署前要补充安全策略、成本和失败恢复评价。
从可复现训练走向多框架部署
Agent Lightning 1.0适合已有Agent产品做后训练:保留原有工具和控制流,通过代理记录模型交互,再把验证器或任务结果转成奖励。这样训练环境更接近实际部署,框架升级时也能观察轨迹格式是否变化。
下一步要验证跨框架迁移和长期任务。相同模型在不同Agent外壳里可能因上下文压缩、工具描述和重试策略产生不同轨迹;训练得到的策略能否跨外壳复用,需要按同一任务集直接比较。作者已公开完整编程训练脚本,外部复现应同时报告成功率、训练成本、无效轨迹比例和安全失败类型。