Le 29 septembre, OpenAI a dévoilé GPT-6.1 Sol lors de DevDay 2026 : une évolution de GPT-6 Sol qui, selon OpenAI, approche l'intelligence de GPT-6 Astra sur le codage agentique, le computer use et les charges de travail professionnelles, pour un cinquième des prix standard des tokens d'entrée et de sortie.
Le prix est au cœur de cette annonce. Les tarifs API standard sont de 2 dollars par million de tokens d'entrée et 10 dollars par million de tokens de sortie, avec une entrée en cache à seulement 0,10 dollar — 95 % de moins que l'entrée standard et moitié moins que l'entrée en cache de GPT-6 Sol. Selon OpenAI, cela donne aux développeurs bien plus de marge pour construire et exploiter des agents qui réutilisent le contexte d'une requête à l'autre. Depuis le 29 septembre, GPT-6.1 Sol est disponible pour les utilisateurs Plus, Pro, Business, Enterprise et Edu dans ChatGPT Work et Codex ; les développeurs y accèdent via l'API sous le nom gpt-6.1-sol. Il n'est pas encore disponible dans Chat. Une option GPT-6.1 Sol Ultrafast, avec une génération de tokens jusqu'à 8 fois plus rapide dans Codex, arrive dans les prochains jours.
Benchmarks : là où il a rattrapé Astra
- DeepSWE v1.1 (tâches d'ingénierie logicielle de longue haleine dans de vraies bases de code) : GPT-6.1 Sol égale Astra pour environ un cinquième du coût, et dépasse le meilleur score de GPT-6 Sol de 6,4 points avec un effort de raisonnement moindre.
- GDP.pdf (répondre à des questions professionnelles à partir de PDF complexes avec tableaux, graphiques et mentions fines) : devant Opus 5.5 avec fallbacks à moins de la moitié du coût par tâche, proche du niveau record d'Astra pour environ un cinquième du coût.
- AutomationBench (workflows métier multi-étapes sur 47 outils couvrant ventes, marketing et opérations) : 2,2 points au-dessus d'Opus 5.5 à effort de raisonnement moyen pour environ un tiers du coût ; 4,8 points au-dessus de GPT-6 Sol.
- Ensemble hors ligne OSWorld 2.0 (workflows computer-use de longue haleine) : 7 points au-dessus de GPT-6 Sol ; à 2,1 points d'Astra à effort maximal pour environ un septième du coût par tâche.
- Terminal-Bench Science 0.1 (workflows scientifiques : analyse de données, simulation, démonstration de théorèmes) : plus du double du score de GPT-6 Sol, à 5,47 dollars par tâche en moyenne contre 23,21 pour Opus 5.5 et 23,80 pour Astra.
Factualité et sécurité : moins d'erreurs, un comportement plus sage
Dans les évaluations de factualité, la part de réponses contenant une erreur factuelle à faible effort de raisonnement est passée de 11,4 % à 7,7 % — une baisse d'environ 32 % — en restant à moins de 1,9 point d'Astra sur tous les réglages. Les évaluations d'alignement montrent pour GPT-6.1 Sol des taux d'échec inférieurs à GPT-6 Sol sur des défis comme signaler un outil de recherche défectueux, respecter des restrictions explicites ou éviter des résultats non autorisés dans des tâches agentiques ; OpenAI indique n'avoir observé aucune tentative de contourner un réviseur de sécurité automatisé, à égalité avec Astra et GPT-6 Sol.
Ce que cela signifie : après la pause d'Astra, Sol devient le choix pragmatique
Quelques jours plus tôt seulement, OpenAI avait annulé la sortie prévue de GPT-6.1 Astra, le modèle n'ayant pas satisfait les standards internes de sécurité et d'alignement. Astra, c'est l'intelligence maximale ; Sol, c'est une intelligence suffisante à un prix réellement utilisable. Pour les développeurs, le vrai signal est une structure de coûts transformée pour les tâches agentiques de longue haleine : une entrée en cache à 0,10 dollar par million de tokens fait passer « nourrir un agent avec toute une base de code pendant des semaines » du luxe à la routine. Le compromis est tout aussi clair : ce n'est toujours pas Astra — les 68,1 % d'Astra sur Terminal-Bench Science restent le meilleur score, et OpenAI recommande toujours Astra pour la recherche scientifique la plus exigeante.