Microsoft-Decision-1 wurde am 9. Oktober 2026 von Microsoft im offiziellen Blog vorgestellt, ist ab sofort in Microsoft Foundry verfügbar und soll bald auch über OpenRouter kommen. Das Modell schreibt keine langen Texte und rätselt nicht offen herum. Seine einzige Aufgabe: Für jede Option einer festen Auswahl eine kalibrierte Wahrscheinlichkeitsbewertung vergeben, damit Software mit dem Wert sofort weiterarbeiten kann.
Eine andere Aufgabe als ein allgemeines Sprachmodell
Microsoft-Decision-1 entstand durch Nachtraining von Qwen3.5-9B auf schnelle Entscheidungsbewertung in einem einzigen Durchlauf; künftig will Microsoft die Basis auf eigene MAI-Modelle und OpenAI-Modelle umstellen. Unterstützt werden Ja/Nein-Fragen, Multiple Choice und Bewertungsskalen, außerdem die Benotung von KI-Antworten und Agentenaktionen nach vorgegebenen Kriterien – alles über eine einfache, strukturierte API. Warum ein eigenes Modell nur fürs Entscheiden? Microsofts Begründung ist pragmatisch: Jede Entscheidung kostet Zeit, und 100 zusätzliche Millisekunden über 20 aufeinanderfolgende Entscheidungen summieren sich auf zwei Sekunden. Ein großes Allzweckmodell jeden dieser Schritte ausführlich durchdenken zu lassen, wird bei Volumen zu langsam und zu teuer.
Zwei Zahlen zuerst: Latenz und Stabilität
In 36 Benchmarks mit fast 150.000 Fragen, die für das Training gesperrt blieben – darunter Routing, Ranking, langer Kontext, Mehrsprachigkeit und Sicherheit –, erreichte Microsoft-Decision-1 in Microsofts eigener Messung die höchste Genauigkeit. Die P50-Latenz lag rund 35-mal niedriger als bei GPT-6 Sol und 4,5-mal niedriger als beim Zweitplatzierten Quyet-1.0-Large. Auch die Stabilität wurde gesondert geprüft: Dieselbe Anfrage wurde auf acht Arten verändert – Umformulierung, geänderte Reihenfolge, geänderte Schlüssel, Formatrauschen – und die Entscheidung kippte nur bei durchschnittlich 1,3 % der Fälle, bei umformulierten Optionsbeschreibungen und umgekehrter Reihenfolge überhaupt nicht. Die Wahrscheinlichkeit ist Teil der API-Ausgabe: Eine Vorhersage von 90 % soll in repräsentativen Fällen etwa neun von zehn Mal stimmen, damit Anwendungen entscheiden können, ob sie ausführen, aufschieben oder einen Menschen prüfen lassen. Zur Sicherheit wurde das Modell mit 5.250 Anfragen in 11 Benchmarks zu schädlichen Inhalten, Jailbreaks und Prompt Injection getestet; es verweigerte schädliches Verhalten und blieb dabei weitgehend nützlich.
Wo Microsoft es intern bereits einsetzt
Das Xbox-Forschungsteam sortierte damit mehr als 10.000 Rückmeldungen von Spielern in feste Themen – in der Qualität auf Augenhöhe mit GPT-6 Sol, aber über 14-mal schneller und zu etwa einem Zweihundertstel der Kosten. Das Copilot-Team bewertet damit Chat- und Agentenantworten und berichtet von Qualität auf dem Niveau von GPT-5.6 Luna bei 100-facher Geschwindigkeit. Bereitschaftsingenieure nutzen es für die Wissenssuche im Störfall, und Microsoft Discovery lässt damit Experimentpläne benoten und adaptiv neu planen – 46-mal konsistenter als eine Benotung per Sprachmodell und insgesamt fast viermal schneller. Microsoft ist mit diesem Ansatz nicht allein: OpenAI hat dieselbe Art von Entscheidung bereits als Schnittstelle angeboten, wie unser früherer Beitrag zur öffentlichen Beta der Decisions API zeigt. Der Unterschied: Microsoft macht die Entscheidung zu einem eigenständigen Modell statt zu einem Modus eines großen.
Der Preis liegt bei 0,042 US-Dollar pro Million Eingabe-Token, die Ausgabe ist kostenlos. Das Modell passt zu Entscheidungen mit vorgegebenen Optionen: Modell-Routing, Klassifizierung, Priorisierung, Validierung, Workflow-Steuerung und die Prüfung des nächsten Schritts eines Agenten. Für offene Fragen ohne feste Auswahl taugt es nicht. Teams mit vielen strukturierten Entscheidungen sollten vor der Einführung zwei Dinge an eigenen Daten prüfen: ob Entscheidungen eine Umformulierung überstehen und ob die ausgegebenen Wahrscheinlichkeiten zur tatsächlichen Trefferquote passen. Der Ranglistenplatz kommt danach.