Databricks hat den "Release neuer Modelle" in eine Pipeline verwandelt, die nach drei Tagen ein Ergebnis liefert: Am Releasetag erhalten alle 12.000 Mitarbeiter Zugriff; drei Tage später entscheiden Messdaten über Beförderung oder Ausmusterung. Databricks hat den internen Prozess am 28. September 2026 in seinem offiziellen Blog beschrieben – mit Blick auf zwei Probleme, die jedes Unternehmen kennt, das Geld in KI steckt.
Das erste: "Frontier" ist nicht immer echte Frontier. Databricks nennt als Beispiel Opus 5.0, das in den internen Qualitätsbewertungen der eigenen Ingenieure schlechter abschnitt als das günstigere Opus 4.8 – bei höherem Preis. Wer ohne Prüfung massenhaft auf ein "zurückgefallenes" neues Modell migriert, schadet sich selbst. Das zweite Problem sind explodierende Kosten: Als Databricks GPT Astra einer Kontrollgruppe ohne Kostenbremsen öffnete, stiegen die KI-Ausgaben pro Entwickler über Nacht um 60 Prozent – bei über zehntausend Nutzern nicht mehr budgetierbar.
Drei Schritte: Zugang am Releasetag, Budget-Leitplanken, Urteil nach drei Tagen
Erstens: Neue Modelle stehen am Releasetag allen zur Verfügung, aber einheitlich mit dem Tag "experimentell". Die Verteilung läuft über das selbst entwickelte Unity Gateway – die zentrale Drehscheibe für Governance, Kostenmanagement und Observability; Claude Code, Codex und das hauseigene Omnigent auf den Mitarbeiter-Laptops holen per vorinstalliertem UG CLI beim Start die neueste Konfiguration. Zweitens: Vier Budgets pro Nutzer sichern ab – ein monatliches Maximum, ein tägliches Runaway-Limit, ein "Quality-Frontier-Budget" nur für Topmodelle und ein "Experimental-Budget" für neue Modelle, damit unbewährte Modelle nicht massenhaft missbraucht werden. Drittens: Nach drei Tagen entscheiden drei Signale – private interne Benchmarks (Offline-Tasks plus Kopf-an-Kopf-Läufe alt gegen neu), Mundpropaganda der Power-User und Kostentracking aus OpenTelemetry-Traces.
Messergebnisse: Opus 5.5 minus 29 %, GPT-6 Sol minus 48 %
Die Woche ab dem 21. September war der Praxistest: Opus 5, GPT-6 Sol und GPT-Luna erschienen innerhalb weniger Tage; Databricks öffnete sie am selben Tag für alle und bestätigte drei Tage später, dass alle drei auf der Kosten-/Qualitäts-Frontier liegen – dann wurden sie übernommen. Im Kohortenvergleich zur Vorwoche:
| Vergleich | Altes Modell (Ø $/Session) | Neues Modell (Ø $/Session) | Veränderung |
|---|---|---|---|
| Opus 4.8 vs Opus 5.5 | $5,94 | $4,23 | -29 % |
| GPT-5.6 Sol vs GPT-6 Sol | $4,52 | $2,34 | -48 % |
Das Fazit: Opus 5.5 wird nächste Woche zum Standardmodell für Claude Code; GPT-6 Sol ist zwar billiger, aber gelegentlich qualitativ schwächer als GPT-5.6 Sol – deshalb wird es nicht Codex-Standard, sondern nur ins Toolkit des Smart Routers aufgenommen.
Der Wert dieses Playbooks liegt nicht darin, "welches Modell gewonnen hat", sondern in einer wiederholbaren Enterprise-Antwort: Benchmark-Punkte sind nicht gleich reale Leistung auf den eigenen Workloads – die Auswahl muss auf Messdaten beruhen; und Kostenkontrolle funktioniert nicht über guten Willen, sondern über Budgetmechanik. Dass Opus 5.5 in Databricks' Tests zum Standard aufstieg, bestätigt auch die doppelte Führung des Modells bei Kosten und Leistung.