ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
GPT-6 Sol (Max) entre dans l'Agent Arena : +7,7 %, 6e place, 0,76 $ par tâche

GPT-6 Sol (Max) entre dans l'Agent Arena : +7,7 %, 6e place, 0,76 $ par tâche

Informations sur l’IA • Admin • • 5 vues

Le 25 septembre, Arena (anciennement LMArena) a mis à jour son classement : GPT-6 Sol (Max) a officiellement rejoint l'Agent Arena, avec +7,7 % d'amélioration nette et une 6e place sur 44 modèles, sur la base de plus de 4 000 sessions agentiques réelles. Deux jours après la sortie de GPT-6 Sol, c'est le premier verdict complet d'une évaluation tierce participative.

Le bulletin : plus fort que son prédécesseur — et moins cher

L'analyse officielle d'Arena a donné plusieurs chiffres clés. GPT-6 Sol (Max) affiche +7,7 % d'amélioration nette, soit 1,5 point de plus que les +6,2 % de GPT-5.6 Sol (xHigh), et grimpe de la 8e à la 6e place — à moitié prix au token par rapport à son prédécesseur.

Sur le sous-signal « Confirmed Success » (succès confirmé), Sol (Max) atteint +11,4 % et la 4e place ; 5.6 Sol n'y faisait que +2,9 %, 20e. Autrement dit, le nouveau modèle n'est pas seulement plus fort dans l'ensemble — ses plus gros progrès portent sur la métrique la plus importante pour un agent : mener réellement la tâche à bien.

La vraie nouvelle : la frontière du rapport qualité-prix a été redessinée

La frontière de Pareto de l'Agent Arena ressemble désormais à ceci : Claude Fable 5.1 (Max) à +13,8 % pour 4,06 $ par tâche ; GPT-6 Astra (Max) à +10,85 % pour 2,90 $ ; Claude Opus 5 (High) à +9,8 % pour 2,16 $ ; Claude Fable 5 (High) à +8,3 % pour 1,71 $ ; GPT-6 Sol (Max) à +7,68 % pour 0,76 $ par tâche.

Sol (Max) n'est qu'à 0,6 point de Fable 5 (High), pour un coût par tâche inférieur de 56 %. Pour les équipes qui exécutent des milliers de tâches agentiques par jour, cette combinaison est plus attractive qu'un simple trophée de première place — Arena a d'ailleurs noté que cette mise à jour a « redessiné la frontière de Pareto de l'Agent Arena », ramenant le coût médian au niveau de 0,76 $.

Contexte : sorti il y a deux jours à peine

Le 23 septembre, OpenAI lançait GPT-6 Sol et Luna : la recette d'entraînement du vaisseau amiral Astra déclinée en paliers plus rapides et moins chers, avec des prix API inférieurs de 50 % aux tarifs promotionnels de GPT-5.6. Sol est le palier amiral de la famille GPT-6, destiné au code, aux tâches longues et aux missions les plus difficiles. Ces débuts dans l'Arena confirment largement l'affirmation officielle « plus intelligent par token » — du moins sur les tâches agentiques, performance et coût évoluent tous deux dans le bon sens.

Le verdict pour les développeurs

Si vous choisissez un modèle pour faire tourner des agents, la conclusion est simple : pour la puissance absolue, Fable 5.1 (Max) et Astra (Max) restent devant ; mais mesuré en « tâches réussies par dollar », Sol (Max) est actuellement l'option amirale la plus avantageuse de la frontière. Une réserve : Arena est un signal participatif issu de tests aveugles de la communauté, qui reflète les victoires et défaites sur de vraies tâches d'utilisateurs — pas un benchmark de laboratoire. Le classement peut encore bouger à mesure que les votes affluent.

Claude Opus 5.5 est là : 40 % moins cher, optimisé pour les sessions de code ultra-longues était la réponse d'Anthropic la même semaine — la bataille du classement des agents ne fait que commencer.

Outils Recommandés

Plus