Ataraxos est le système d'IA que des équipes du MIT, de Carnegie Mellon, de NYU et de Stanford ont publié dans Nature le 30 septembre 2026. Il a battu le joueur humain numéro un mondial au « Stratego » avec une large marge — la première fois qu'une IA distance aussi nettement l'élite humaine dans un jeu à information imparfaite. Son nom vient du grec et signifie « imperturbable », ce qui décrit aussi son style de jeu.
Premier coup : une stratégie « plan directeur » forgée par l'auto-jeu
L'équipe a entraîné Ataraxos par apprentissage par renforcement en auto-jeu : le modèle joue d'énormes quantités de parties contre lui-même et distille une stratégie plan directeur. Les algorithmes sont plus efficaces : ils apprennent vite et n'énumèrent jamais chaque coup possible. La force de jeu dépasse strictement DeepNash de DeepMind, avec moins d'un centième de ses exemples d'entraînement et moins d'un trentième de ses parties d'auto-jeu — tandis que l'ancienne approche de DeepMind, malgré des millions de dollars de coûts d'entraînement, n'a jamais battu les meilleurs joueurs humains.
Deuxième coup : reconstituer mentalement les pièces cachées avant d'agir
La stratégie plan directeur n'est qu'un point de départ. Avant chaque coup, Ataraxos affine son choix sur le vif par planification au moment de la décision : il fait appel à un modèle génératif pour inférer de façon probabiliste l'identité des pièces cachées de l'adversaire, reconstitue l'état du plateau le plus plausible, puis évalue les suites et choisit le meilleur coup. L'équipe voit dans cet usage innovant d'un modèle génératif la pièce manquante vers la performance surhumaine.
Le bilan — et il se généralise
Ataraxos a battu le plus fort joueur de Stratego au monde 15-1-4, une marge record, et a signé un 39-2 face aux meilleurs humains au championnat du monde. Il a aussi été porté vers Barrage Stratego, le jeu de cartes coopératif Hanabi et le Dou dizhu à « deux contre un » — surhumain partout.
Son calcul du risque diffère fortement de l'humain : un atout exposé fait paniquer l'humain, qui surcorrige et laisse fuir de l'information ; Ataraxos reste d'un calme troublant et ne livre rien.
Du plateau à la table des négociations
Le Stratego sert couramment de modèle aux problèmes réels à information imparfaite : trading, commandement, négociation et cybersécurité partagent la même structure. La prochaine étape de l'équipe est l'interprétabilité — apprendre à Ataraxos à expliquer ses décisions : « Les humains doivent avoir le dernier mot sur l'adoption d'une recommandation ; avant tout déploiement, il faut pouvoir auditer les décisions du modèle. »
La décision pilotée par l'apprentissage par renforcement a déjà fait ses preuves dans les modèles de raisonnement — QwQ-32B d'Alibaba a utilisé l'apprentissage par renforcement pour hisser un raisonnement de 32B au niveau de modèles plus grands. Ataraxos prouve que l'approche fonctionne tout aussi bien quand les cartes restent cachées.