ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Databricks lässt 12.000 Mitarbeiter neue Modelle am Releasetag testen – nach drei Tagen entscheiden die Daten

Databricks lässt 12.000 Mitarbeiter neue Modelle am Releasetag testen – nach drei Tagen entscheiden die Daten

KI-Informationen • Admin • • 8 Aufrufe

Databricks hat den "Release neuer Modelle" in eine Pipeline verwandelt, die nach drei Tagen ein Ergebnis liefert: Am Releasetag erhalten alle 12.000 Mitarbeiter Zugriff; drei Tage später entscheiden Messdaten über Beförderung oder Ausmusterung. Databricks hat den internen Prozess am 28. September 2026 in seinem offiziellen Blog beschrieben – mit Blick auf zwei Probleme, die jedes Unternehmen kennt, das Geld in KI steckt.

Das erste: "Frontier" ist nicht immer echte Frontier. Databricks nennt als Beispiel Opus 5.0, das in den internen Qualitätsbewertungen der eigenen Ingenieure schlechter abschnitt als das günstigere Opus 4.8 – bei höherem Preis. Wer ohne Prüfung massenhaft auf ein "zurückgefallenes" neues Modell migriert, schadet sich selbst. Das zweite Problem sind explodierende Kosten: Als Databricks GPT Astra einer Kontrollgruppe ohne Kostenbremsen öffnete, stiegen die KI-Ausgaben pro Entwickler über Nacht um 60 Prozent – bei über zehntausend Nutzern nicht mehr budgetierbar.

Drei Schritte: Zugang am Releasetag, Budget-Leitplanken, Urteil nach drei Tagen

Erstens: Neue Modelle stehen am Releasetag allen zur Verfügung, aber einheitlich mit dem Tag "experimentell". Die Verteilung läuft über das selbst entwickelte Unity Gateway – die zentrale Drehscheibe für Governance, Kostenmanagement und Observability; Claude Code, Codex und das hauseigene Omnigent auf den Mitarbeiter-Laptops holen per vorinstalliertem UG CLI beim Start die neueste Konfiguration. Zweitens: Vier Budgets pro Nutzer sichern ab – ein monatliches Maximum, ein tägliches Runaway-Limit, ein "Quality-Frontier-Budget" nur für Topmodelle und ein "Experimental-Budget" für neue Modelle, damit unbewährte Modelle nicht massenhaft missbraucht werden. Drittens: Nach drei Tagen entscheiden drei Signale – private interne Benchmarks (Offline-Tasks plus Kopf-an-Kopf-Läufe alt gegen neu), Mundpropaganda der Power-User und Kostentracking aus OpenTelemetry-Traces.

Messergebnisse: Opus 5.5 minus 29 %, GPT-6 Sol minus 48 %

Die Woche ab dem 21. September war der Praxistest: Opus 5, GPT-6 Sol und GPT-Luna erschienen innerhalb weniger Tage; Databricks öffnete sie am selben Tag für alle und bestätigte drei Tage später, dass alle drei auf der Kosten-/Qualitäts-Frontier liegen – dann wurden sie übernommen. Im Kohortenvergleich zur Vorwoche:

VergleichAltes Modell (Ø $/Session)Neues Modell (Ø $/Session)Veränderung
Opus 4.8 vs Opus 5.5$5,94$4,23-29 %
GPT-5.6 Sol vs GPT-6 Sol$4,52$2,34-48 %

Das Fazit: Opus 5.5 wird nächste Woche zum Standardmodell für Claude Code; GPT-6 Sol ist zwar billiger, aber gelegentlich qualitativ schwächer als GPT-5.6 Sol – deshalb wird es nicht Codex-Standard, sondern nur ins Toolkit des Smart Routers aufgenommen.

Der Wert dieses Playbooks liegt nicht darin, "welches Modell gewonnen hat", sondern in einer wiederholbaren Enterprise-Antwort: Benchmark-Punkte sind nicht gleich reale Leistung auf den eigenen Workloads – die Auswahl muss auf Messdaten beruhen; und Kostenkontrolle funktioniert nicht über guten Willen, sondern über Budgetmechanik. Dass Opus 5.5 in Databricks' Tests zum Standard aufstieg, bestätigt auch die doppelte Führung des Modells bei Kosten und Leistung.

Empfohlene Tools

Mehr