ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Artificial Analysis évalue GPT-6 Sol et Luna : coûts divisés par deux, résultats contrastés

Artificial Analysis évalue GPT-6 Sol et Luna : coûts divisés par deux, résultats contrastés

Informations sur l’IA Admin 7 vues

Le 22 septembre 2026, l'organisme indépendant d'évaluation de l'IA Artificial Analysis a publié son rapport sur GPT-6 Sol et GPT-6 Luna — le premier bulletin de notes tiers complet depuis le lancement des deux modèles. Les prix sont bel et bien divisés par deux, mais le bilan des performances n'est pas unilatéral : certains benchmarks progressent, d'autres régressent.

La mesure centrale d'Artificial Analysis : un passage complet de l'Intelligence Index coûte environ 1,06 dollar par tâche avec GPT-6 Sol (effort maximal), soit près de moitié moins que les 1,99 dollars de GPT-5.6 Sol ; Luna passe de 0,18 à 0,07 dollar par tâche, une baisse d'environ 60 %. Le score global de l'Intelligence Index reste au niveau de la génération précédente, mais le détail diverge : Sol progresse légèrement sur les agents de codage tandis que Luna recule un peu, et les deux régressent sur les évaluations de travail de connaissance.

La baisse de prix est réelle : tarifs API divisés par deux

Les prix d'entrée/sortie de Sol passent de 4/20 à 2/10 dollars par million de tokens ; Luna passe de 0,20/1,20 à 0,10/0,50 dollar, avec la même remise de 90 % sur les lectures de cache et une majoration de 25 % sur les écritures. Fait notable : les deux modèles consomment même un peu plus de tokens de sortie par tâche (Sol : 31k contre 29k) — l'économie provient entièrement de la baisse des prix. Les modèles testés sont les GPT-6 Sol et Luna présentés par OpenAI le 22 septembre (déjà couverts dans notre article de lancement).

En progrès : codage et contrôle des hallucinations

Sur le Coding Agent Index d'Artificial Analysis (mesuré dans l'environnement Codex d'OpenAI), Sol obtient 57 points, soit 2 de plus que GPT-5.6 Sol ; Terminal-Bench 4.0 passe de 37 % à 43 %. Le contrôle des hallucinations s'améliore aussi nettement : sur le benchmark de connaissances AA-Omniscience, le taux d'hallucination de Sol chute de 92 % à 60 %, celui de Luna de 93 % à 77 %. La recette de Sol, c'est la prudence : le taux de réponse passe de 99 % à 83 %, les mauvaises réponses reculent d'environ un quart — mais la précision baisse aussi, de 59 % à 54 %.

En recul : les évaluations de travail de connaissance fléchissent pour les deux

Sur GDPval-AA v2.1 (tâches à valeur économique couvrant 44 professions), Sol perd environ 100 points Elo et Luna environ 75 ; Luna cède aussi quelque 45 points sur AA-Briefcase v1.1, une évaluation de projets de connaissance s'étalant sur plusieurs semaines (Sol reste stable). Après examen manuel de centaines de sorties, l'équipe attribue ces reculs à des livrables plus courts qui omettent des éléments exigés par la grille — les modèles écrivent trop brièvement pour économiser des tokens.

Choisir selon la charge de travail, pas seulement selon l'étiquette de prix

Pour les tâches de code dans des agents comme Codex, Sol est le meilleur choix : score plus élevé à 2,99 dollars par tâche — moitié moins que la génération précédente — pile sur la frontière de Pareto capacité-coût. Pour les tâches routinières à haut volume comme l'extraction et le résumé, l'avantage de coût de Luna reste convaincant ; mais pour le travail de connaissance impliquant de longs documents et des livrables complets, mieux vaut valider l'exhaustivité des sorties sur un petit trafic avant de basculer entièrement.

Cette baisse est intervenue le jour même où Anthropic présentait Claude Opus 5.5 avec une réduction de 20 % — les deux laboratoires de pointe ont dégainé la carte des prix en l'espace de 24 heures. La conclusion d'Artificial Analysis est mesurée : OpenAI s'est adjugé une large part de la frontière de l'efficacité-coût, mais moins cher ne veut pas dire plus fort partout. Pour choisir un modèle, l'essentiel est de savoir si votre charge de travail se situe du côté des progrès ou du côté des reculs.

Outils Recommandés

Plus