Agent Lightning 1.0이 2026년 10월 7일 Microsoft Research Asia에서 오픈소스로 공개됐다. 프레임워크 전체가 약 3,500줄에 불과하다. 이 도구가 겨냥하는 것은 에이전트 강화학습의 오랜 골칫거리다. 지금까지 에이전트를 RL로 훈련하려면 훈련 프레임워크 안에 에이전트를 다시 구현해야 했고, 그렇게 훈련된 것은 실제 배포되는 에이전트와 미묘하게 달랐다. 이번에 제시된 패러다임은 Harnessed Agentic RL로, 주장은 하나다. 배포할 때 쓰는 하네스(실행 기반) 자체가 훈련에 참여해야 한다는 것이다.
기존 방식의 무엇이 문제였나
오늘날 코딩 에이전트는 모델 하나가 아니다. 컨텍스트 관리, 도구 프로토콜, 실행 로직, 의존 환경을 각자 들고 있어서 mini-SWE-agent, OpenHands, Claude Code, Codex가 제각각이다. verl, AReaL, slime 같은 기존 에이전트 RL 시스템은 훈련 프레임워크가 상호작용 루프를 소유한다고 가정하므로 에이전트를 바꿀 때마다 루프를 다시 짜야 했다. 비용이 클 뿐 아니라 재구현본과 배포본의 동작이 조용히 어긋나 훈련 점수는 좋아도 실서비스가 따라오지 못하는 일이 생긴다. 지난 1년간 에이전트 규모 개발 인프라가 커지면서 반복된 마찰이기도 하다.
핵심은 중간에 프록시를 끼우는 것
Agent Lightning은 에이전트와 모델 사이에 OpenAI 호환 LLM 프록시를 둔다. 에이전트 코드는 건드릴 필요가 없다. 원래 모델을 호출하던 주소를 이 프록시로 돌리면 훈련 시스템이 각 호출의 프롬프트, 응답, 로그 확률을 기록해 RL 훈련 재료로 쓸 수 있다. v1.0은 세 부분으로 구성된다. 롤아웃 저장과 프록시를 맡는 API 게이트웨이, 에이전트 실행을 띄우는 롤아웃 컨트롤러, verl 위에 만든 맞춤형 트레이너다. 실행은 Kubernetes 네이티브로 에이전트가 표준 K8s 작업으로 돌아가므로 유료 상용 샌드박스 없이 대규모 샘플링 비용을 낮출 수 있다. Collocated Async RL이라는 스케줄링은 롤아웃과 모델 업데이트가 같은 GPU를 나눠 쓰게 해 동기 RL보다 약 2배 빠른 전체 속도를, 완전 비동기 방식보다 적은 GPU로 달성했다고 한다.
샘플 6,000개로 14.6포인트 상승
함께 공개된 코딩 에이전트 훈련 파이프라인은 SWE-smith 데이터, mini-SWE-agent, Qwen3.5-9B 조합에 훈련 샘플 약 6,000개만으로 대규모 연산 없이 돌릴 수 있다. RL 훈련만으로 SWE-bench Verified의 Pass@1이 41.8%에서 56.4%로 14.6포인트 올랐다. 실무자가 눈여겨볼 세부 사항도 있다. 롤아웃 하나가 여러 훈련 샘플로 쪼개질 때 어드밴티지 계산과 손실 정규화는 샘플 단위가 아니라 롤아웃 단위로 해야 한다. 그렇지 않으면 샘플이 많은 롤아웃이 과하게 가중돼 검증 보상과 정책 엔트로피가 모두 불안정해진다.
지금 써볼 만한 팀은
이미 돌아가는 하네스가 있고 재구현 비용 때문에 RL 후훈련을 미뤄온 팀이라면 정확히 그 팀을 위한 도구다. 연결 지점은 프록시 주소 하나고, 코드 규모도 처음부터 끝까지 읽을 수 있다. 반대로 에이전트 자체가 아직 불안정하거나 보상 설계가 흐릿하다면 순서가 아니다. 이 프레임워크가 답하는 것은 '실제 하네스를 어떻게 훈련에 참여시킬 것인가'이지 '무엇이 좋아진 것인가'가 아니다. 완전히 검증된 사례는 현재 코딩 에이전트 하나뿐이라 다른 종류의 에이전트에서의 효과는 커뮤니티 결과를 기다려야 한다.