ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Agent Lightning 1.0 als Open Source: RL-Training echter Harnesses in 3.500 Zeilen

Agent Lightning 1.0 als Open Source: RL-Training echter Harnesses in 3.500 Zeilen

KI-Informationen • Admin • • 6 Aufrufe

Agent Lightning 1.0 wurde am 7. Oktober 2026 von Microsoft Research Asia als Open Source veröffentlicht — das gesamte Framework umfasst nur rund 3.500 Zeilen Code. Es adressiert ein altes Ärgernis des agentischen Reinforcement Learning: Wer einen Agenten mit RL trainieren wollte, musste ihn bisher im Trainingsframework nachbauen, sodass das Trainierte nie ganz der ausgelieferte Agent war. Das neue Paradigma heißt Harnessed Agentic RL und beruht auf einem Satz: Das Harness, mit dem ausgeliefert wird, soll selbst am Training teilnehmen.

Was am alten Weg nicht stimmt

Ein moderner Coding-Agent ist mehr als ein Modell. Kontextverwaltung, Tool-Protokolle, Ausführungslogik und Abhängigkeiten bringt jeder selbst mit — mini-SWE-agent, OpenHands, Claude Code und Codex ticken jeweils anders. Klassische RL-Systeme wie verl, AReaL oder slime setzen voraus, dass das Trainingsframework die Interaktionsschleife besitzt. Jeder neue Agent bedeutet also: Schleife nachbauen. Das kostet Zeit, und der Nachbau verhält sich womöglich still anders als das Original — gute Trainingswerte, abweichende Produktion. Dieselbe Reibung trat im vergangenen Jahr immer wieder auf, als die Infrastruktur für Entwicklung im Agenten-Maßstab wuchs.

Der Trick ist ein Proxy dazwischen

Agent Lightning setzt einen OpenAI-kompatiblen LLM-Proxy zwischen Agent und Modell. Der Agent bleibt unverändert: Man zeigt seinen bisherigen Modell-Endpunkt auf den Proxy, und das Trainingssystem protokolliert jeden Prompt, jede Antwort und die Log-Wahrscheinlichkeiten als RL-Trainingsmaterial. Version 1.0 besteht aus drei Teilen: einem API-Gateway, das Rollouts speichert und den Proxy stellt, einem Rollout-Controller, der Agentenläufe startet, und einem auf verl aufbauenden, angepassten Trainer. Die Ausführung läuft nativ auf Kubernetes, Agenten als Standard-Jobs statt auf bezahlten Sandbox-Diensten — das hält große Rollout-Mengen bezahlbar. Ein Verfahren namens Collocated Async RL lässt Rollouts und Modell-Updates dieselben GPUs teilen und erreicht damit rund doppelte End-to-End-Geschwindigkeit gegenüber synchronem RL, mit weniger GPUs als voll asynchrone Ansätze.

6.000 Beispiele, plus 14,6 Punkte

Mitgeliefert wird eine komplette Trainings-Pipeline für Coding-Agenten: SWE-smith-Daten, mini-SWE-agent als Harness, Qwen3.5-9B als Basismodell und nur etwa 6.000 Trainingsbeispiele, ganz ohne Großrechner. Allein das RL-Training hob die Pass@1 auf SWE-bench Verified von 41,8 % auf 56,4 % — ein Plus von 14,6 Prozentpunkten. Ein Detail für Praktiker: Zerfällt ein Rollout in mehrere Trainingsbeispiele, müssen Advantage-Berechnung und Loss-Normalisierung auf Rollout-Ebene erfolgen, nicht auf Beispiel-Ebene. Sonst werden Rollouts mit vielen Beispielen mehrfach gezählt, und sowohl Validierungs-Reward als auch Policy-Entropie werden instabil.

Wer es jetzt ausprobieren sollte

Wer bereits ein lauffähiges Agenten-Harness besitzt und RL-Nachtraining wegen der Nachbau-Kosten aufgeschoben hat, ist die Zielgruppe: Anbindung über eine Proxy-Adresse, Codebasis klein genug zum Durchlesen. Wer dagegen einen noch instabilen Agenten oder ein unscharfes Reward-Signal hat, sollte warten — das Framework beantwortet, wie ein echtes Harness ins Training kommt, nicht, was „besser" für den eigenen Agenten heißt. Vollständig demonstriert ist bislang nur eine Pipeline für Coding-Agenten; Ergebnisse für andere Agententypen muss die Community liefern.

Empfohlene Tools

Mehr