ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Agent Lightning 1.0 开源:3500 行代码训练真实智能体

Agent Lightning 1.0 开源:3500 行代码训练真实智能体

AI资讯 • Admin • • 6 次浏览

Agent Lightning 1.0 在 2026 年 10 月 7 日由 Microsoft Research Asia 团队开源发布,整个框架只有约 3500 行代码。它要解决的是智能体强化学习里一个长期别扭的问题:过去想用强化学习训练一个智能体,得先把智能体在训练框架里重新实现一遍,训出来的东西和真正部署的那个并不完全是一回事。这次发布的范式被团队命名为 Harnessed Agentic RL,核心主张只有一句:部署时用的那套智能体运行框架(harness),应该原样参加训练。

旧办法别扭在哪

一个现代编程智能体不只是一个模型。它自带上下文管理、工具协议、执行逻辑和依赖环境,mini-SWE-agent、OpenHands、Claude Code、Codex 各有各的一套。传统智能体强化学习框架(如 verl、AReaL、slime 一类系统)默认训练框架要接管整个交互循环,于是每换一个智能体,就要把它的循环在框架里重写一次:成本高,而且重写版的行为可能和部署版悄悄偏离,训练分数好看,上线却不是那么回事。这种脱节,正是过去一年 智能体开发基础设施 快速膨胀时反复出现的摩擦。

关键一招是在中间加一层代理

Agent Lightning 的做法是在智能体和模型之间放一个兼容 OpenAI 接口的 LLM 代理。智能体不需要改代码,只要把原来调用模型的地址指向这个代理,训练系统就能记录下每一次调用的提示、回复和对数概率,用作强化学习的训练材料。v1.0 的系统由三个部件组成:负责存 rollout 和做代理的 API 网关、负责拉起智能体执行的 Rollout 控制器、以及基于 verl 构建的定制训练器。执行层原生支持 Kubernetes,智能体以标准 K8s 任务的方式批量运行,不依赖付费的商业沙箱服务,大规模采样的成本压得下来。团队还给出一套 Collocated Async RL 调度:采样和模型更新共用同一组 GPU,端到端速度约为同步训练的 2 倍,用的卡又比完全异步方案少。

6000 条样本,涨了 14.6 个百分点

随框架一起给出的是一条完整的编程智能体训练流水线:以 SWE-smith 数据、mini-SWE-agent 为运行框架、Qwen3.5-9B 为底座模型,训练集只有约 6000 条样本,不需要大规模算力。仅靠强化学习训练这一环,模型在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%,涨了 14.6 个百分点。论文式的细节里还有一条值得从业者注意:当一条 rollout 被拆成多个训练样本时,优势计算和损失归一化都要按 rollout 级别处理而不是样本级别,否则产生样本多的 rollout 会被重复加权,验证奖励和策略熵都会不稳。

谁适合现在就试

如果你手上已经有一个能跑的智能体框架,又一直因为"重写成本太高"没做过强化学习后训练,这套东西正是冲着你来的:接入点只是一个代理地址,代码量小到可以通读。如果你的智能体还没跑稳、奖励信号还没设计清楚,先别急——框架解决的是"怎么让真实 harness 参加训练",不替你回答"训什么才算变好"。目前公开验证过的完整案例只有编程智能体这一条线,其他类型智能体上的效果,还要等更多团队跑出结果。

推荐工具

更多