Claude Opus 5.5 (High) est officiellement entré dans le classement Agent Arena le 28 septembre, décrochant la deuxième place dès ses débuts avec un score d'amélioration nette de +12,15 %, juste derrière son compagnon d'écurie Fable 5.1 (Max). Anthropic occupe donc désormais les deux premières places de ce classement d'agents — son plus grand rival, c'est lui-même.
Ce que mesure l'Agent Arena
Contrairement aux classements de texte qui testent des conversations uniques, l'Agent Arena évalue des tâches d'agents réelles : les modèles peuvent utiliser la recherche web, le système de fichiers et des outils de terminal pour accomplir des flux de travail complexes en plusieurs étapes. Le classement repose sur des millions de tâches réelles de longue durée d'utilisateurs du monde entier, et mesure par traçage causal la performance de chaque modèle par rapport à un « modèle moyen », avec des indicateurs comme le taux d'amélioration nette et le taux de réussite de confirmation des tâches. Les +12,15 % d'Opus 5.5, c'est sa marge au-dessus de la moyenne dans ces scénarios « faire le travail ».
À noter : deux jours plus tôt seulement, le 26 septembre, Opus 5.5 venait de prendre la tête du classement texte (Text Arena) avec 1 509 points. Gagner sur deux dimensions différentes en deux jours suggère que cette itération n'est pas une optimisation ponctuelle. Lecture associée
Pour Anthropic, c'est aussi la première fois qu'elle est validée simultanément sur ses deux dimensions de classement — capacité textuelle et performance d'agent en conditions réelles, les deux jambes bien plantées.
La vraie histoire : la stratégie du « flagship moins cher » est validée
C'est le niveau de raisonnement High qui est classé, pas le niveau Max à plein régime. Le tarif officiel d'Opus 5.5 est de 4 dollars par million de tokens d'entrée et 20 dollars par million de tokens de sortie — environ 20 % moins cher que la génération précédente Opus 5 — tandis que ses performances seraient proches de Fable 5.1 selon Anthropic. Qu'un « niveau flagship moins cher » décroche la deuxième place d'un classement d'agents en conditions réelles, c'est une validation participative par un tiers de la stratégie produit d'Anthropic : ne pas chasser les points en empilant les coûts d'inférence, mais intégrer l'efficacité dans le modèle lui-même.
C'est un signal clair pour le marché : la compétition des modèles de pointe glisse de « qui est le plus intelligent » vers « qui est le moins cher à intelligence égale ». Des classements comme l'Agent Arena, qui mesurent des tâches réelles et des coûts réels, deviendront de plus en plus le cadre de référence des acheteurs.
Ce que cela signifie pour le choix d'un modèle
Si vous choisissez un modèle d'agent pour votre équipe, la conclusion est directe : quand il faut une capacité d'agent de premier plan tout en surveillant les coûts, Opus 5.5 (High) est l'une des options flagship au meilleur rapport qualité-prix validées par le classement à ce jour ; si le coût n'est pas un critère et que vous visez le sommet, Fable 5.1 (Max) reste numéro un. Mais n'oubliez pas : les scores Arena proviennent de votes participatifs et d'inférence causale, et reflètent la performance sur des « tâches moyennes » — pour vos propres charges de travail, faire tourner votre propre évaluation avant de décider sera toujours plus fiable que de commander d'après le classement.