ThinkingBox ist ein von Microsoft und Hugging Face am 3. Oktober 2026 gemeinsam veröffentlichter Agenten-Benchmark, der nicht bewertet, was ein Agent am Ende sagt, sondern nur, was er in der Datenbank hinterlässt. Seine 507 zustandsbehafteten Geschäftsabläufe – je rund hundert aus Einzelhandel, Kfz-Versicherung, Reise, Neobank und Consulting-Support – laufen jeweils 20-mal von einem sauberen Backend aus. Steht in einem Ticketfeld ein falscher Wert, gilt der ganze Versuch als gescheitert.
Der Endzustand ist das Zeugnis
Der Beitrag beginnt mit einem Supportfall: Der Agent prüfte Bestellung, Sendungsverfolgung, Kundenprofil und Rückerstattungsregeln, neun formal korrekte Tool-Aufrufe, schloss das Ticket dann als gelöst und teilte der Kundin mit, das Anliegen sei erledigt. Doch die Ausnahme beim Frachtführer war noch offen, der geforderte Endzustand lautete „zurückgestellt“, und die eigentliche Frage der Kundin blieb unbeantwortet. Nach Tool-Aufrufen bewertet nahe an der Bestnote, nach Datenbankzustand bewertet: durchgefallen.
Diese Lücke ist keine Anekdote. In 121.680 gültigen Versuchen mit zwölf Modellen fielen 79.853 durch die ausführbaren Prüfungen. Von diesen Fehlern endeten 67,24 % sauber, riefen ein zustandsänderndes Tool auf und meldeten keinen Schlussfehler – trotzdem fanden die Prüfungen in 77,61 % falsche Feldwerte, in 43,30 % unbeabsichtigte Zusatzwirkungen und in 25,36 % fehlende Pflichtwirkungen. Agenten scheitern am häufigsten nicht an wirren Antworten, sondern daran, selbstbewusst den falschen Datensatz zu schreiben und es nicht zu merken.
Einmal schaffen ist nicht jedes Mal schaffen
Die Rangliste der Einzelversuche wirkt vertraut: Claude Opus 5.5 führt mit 67,16 %, Claude Opus 5 folgt mit 66,50 %, GPT-5.4 mit 65,36 %. Die eigentliche Frage von ThinkingBox ist die zweite: Dieselbe Aufgabe 20-mal laufen lassen – wie viel bleibt übrig?
Kimi-K3 deckt am breitesten ab und löst 476 von 507 Aufgaben mindestens einmal, also 93,89 %. Aber nur 68 Aufgaben, 13,41 %, bestehen alle 20 Läufe. Claude Opus 5 zeigt das umgekehrte Profil: weniger Aufgaben mindestens einmal gelöst, dafür 241 Aufgaben jedes Mal bestanden, 47,53 %. Das neuere Opus 5.5 erzielt den höheren Einzelwert und besteht exakt dieselben 241 Aufgaben in allen 20 Läufen – keine einzige mehr. GPT-6 Astra behält 78 % seiner Einzelleistung, die beste Haltequote im Feld. Ein neueres Modell hebt den Durchschnitt, aber nicht automatisch die Verlässlichkeit.
Verlässlichkeit hat ihren eigenen Preis
Der Beitrag bepreist auch die Zuverlässigkeit: Die Kosten der vollen 20-Runden-Kampagne geteilt durch die Zahl der Aufgaben, die alle 20 Läufe bestanden. GPT-5.4 ist mit 6,80 Dollar pro verlässlicher Aufgabe am günstigsten, schafft die Hürde aber nur bei 128 Aufgaben; GPT-6 Astra kostet 7,45 Dollar bei 231 Aufgaben, Claude Opus 5.5 7,80 Dollar bei 241. Der billigste Weg zu einer richtigen Antwort ist nicht der billigste Weg zu einer verlässlichen.
Auch die Fehlerstruktur ist praxisnah: Rund 79,9 % der Fehler entfallen auf den Umgang mit Tools, falsche Zustandsänderungen auf 10,3 %, unvollständige Antworten auf 7,0 %, und nur 2,9 % unternehmen gar keine zustandsändernde Aktion. Die meisten Agenten verstehen die Aufgabe und stolpern dann über Tool-Fehler, nicht erfüllte Vorbedingungen oder leere Abfragen. Drei Folgen für Betreiber: vor dem Übernehmen den Endzustand prüfen statt der Selbstauskunft des Modells zu vertrauen, Tool-Fehler klassifizieren, damit Wiederholungen nur die behebbaren Fälle treffen, und bei schwer umkehrbaren Änderungen eine menschliche Freigabe verlangen. ThinkingBox ist jetzt über OpenEnv von Hugging Face verfügbar, Teams können ihre eigenen Abläufe vor jeder Einführung an diesem Maßstab nachmessen.