Ataraxos ist das KI-System, das Teams von MIT, Carnegie Mellon, NYU und Stanford am 30. September 2026 in Nature vorgestellt haben. Es schlug den Weltranglistenersten im „Stratego" mit großem Abstand – zum ersten Mal hat eine KI menschliche Spitzenspieler in einem Spiel mit unvollständiger Information entscheidend distanziert. Der Name stammt aus dem Griechischen und bedeutet „unerschütterlich" – was auch seinen Spielstil beschreibt.
Erster Zug: Eine Blaupausen-Strategie, geschmiedet im Selbstspiel
Das Team trainierte Ataraxos mit Self-Play-Reinforcement-Learning: Das Modell spielt riesige Mengen Partien gegen sich selbst und destilliert eine Blaupausen-Strategie. Die Algorithmen sind effizienter: Sie lernen schnell und zählen nie jeden möglichen Zug auf. Die Spielstärke übertrifft DeepMinds DeepNash strikt – bei weniger als einem Hundertstel der Trainingsbeispiele und weniger als einem Dreißigstel der Selbstspiel-Partien. DeepMinds alter Ansatz kam trotz Millionen an Trainingskosten nie an menschlichen Top-Spielern vorbei.
Zweiter Zug: Die verdeckten Steine des Gegners erst im Kopf rekonstruieren
Die Blaupausen-Strategie ist nur der Ausgangspunkt. Vor jedem Zug verfeinert Ataraxos seine Wahl spontan per Decision-Time-Planning: Es ruft ein generatives Modell auf, um die Identität der verdeckten gegnerischen Steine probabilistisch zu erschließen, rekonstruiert den plausibelsten Brettzustand und bewertet dann künftige Verläufe, um den besten Zug zu wählen. Das Team hält diesen innovativen Einsatz eines generativen Modells für das fehlende Puzzleteil auf dem Weg zu übermenschlicher Leistung.
Die Bilanz – und sie ist übertragbar
Ataraxos schlug den stärksten Stratego-Spieler der Welt mit 15:1:4 – ein Rekordabstand – und erreichte bei der Weltmeisterschaft 39:2 gegen menschliche Top-Spieler. Es wurde auch auf Barrage Stratego, das kooperative Kartenspiel Hanabi und „Zwei-gegen-eins"-Dou-dizhu portiert – überall übermenschlich.
Seine Risikokalkulation unterscheidet sich stark vom Menschen: Eine enttarnte Trumpfkarte lässt Menschen in Panik überkorrigieren und Informationen lecken; Ataraxos bleibt unheimlich gelassen und gibt nichts preis.
Vom Brett an den Verhandlungstisch
Stratego dient routinemäßig als Modell für reale Probleme mit unvollständiger Information: Handel, Führung, Verhandlung und Cybersicherheit teilen dieselbe Struktur. Der nächste Schritt des Teams ist Interpretierbarkeit – Ataraxos soll seine Entscheidungen erklären können: „Menschen müssen das letzte Wort haben, ob einer Empfehlung gefolgt wird; vor einer Einführung müssen wir die Entscheidungen des Modells prüfen können."
Reinforcement-Learning-gestützte Entscheidungsfindung hat sich bereits bei Reasoning-Modellen bewährt – Alibabas QwQ-32B nutzte Reinforcement Learning, um 32B-Reasoning auf das Niveau größerer Modelle zu heben. Ataraxos beweist: Der Ansatz funktioniert auch, wenn die Karten verdeckt bleiben.