La famille GPT-6 pose une question pratique de sélection, et OpenAI y a répondu de manière systématique dans son guide officiel, A model guide for the GPT-6 family, publié le 2 octobre 2026. Ce guide ne se contente pas de lister les prix de trois niveaux. Il traite ensemble les niveaux de raisonnement, la mise en cache des prompts, la rédaction des prompts et la gestion des tâches longues, offrant aux équipes de développement une méthode pour configurer coûts et capacités comme une seule décision.
Trois niveaux et leurs prix
| Modèle | Entrée | Sortie | Entrée en cache | Positionnement |
|---|---|---|---|---|
| GPT-6 Astra | 10 dollars | 50 dollars | 1 dollar | Le travail de raisonnement le plus difficile, quand l'intelligence maximale est requise |
| GPT-6.1 Sol | 2 dollars | 10 dollars | 0,10 dollar | Une intelligence proche d'Astra pour un cinquième du prix |
| GPT-6 Luna | 0,10 dollar | 0,50 dollar | 0,01 dollar | Le travail quotidien répétitif à grande échelle, aux objectifs clairs |
Tous les prix s'entendent par million de tokens. GPT-6.1 Sol convient à la programmation complexe, à la recherche et au computer use. GPT-6 Luna vise des tâches répétables comme l'extraction de champs de factures, la classification de demandes et la génération de résumés structurés. Avec des écarts allant jusqu'à cent fois entre les niveaux, un mauvais choix de modèle multiplie directement les coûts.
Choisir le modèle et le niveau de raisonnement ensemble
Le principe central consiste à considérer le choix du modèle et le niveau de raisonnement ensemble, comme un compromis entre intelligence et prix. Low convient au travail routinier comme l'extraction de faits et les petites modifications. Medium convient au travail qui demande du jugement, comme planifier une fonctionnalité ou comparer des options. High convient au débogage difficile, à l'analyse approfondie et à la relecture attentive. Extra high et Max ne devraient être testés que lorsque High ne suffit pas, et conservés uniquement si l'amélioration vaut le temps et le coût supplémentaires. Les équipes ne devraient pas tout régler par défaut au niveau maximal, mais répartir selon la difficulté des tâches.
Cache des prompts et gestion du contexte
Une entrée mise en cache peut coûter jusqu'à 95 % de moins qu'une entrée non mise en cache. Le guide recommande de placer les instructions stables et les documents de référence avant les détails changeants de la tâche, et de garder des définitions d'outils cohérentes pour améliorer les hits de cache. Pour les longues conversations, la compaction peut compresser le contexte tout en préservant l'état nécessaire pour continuer le travail, évitant que les tâches longues ne deviennent toujours plus chères et plus lentes.
La manière de prompter évolue
Eric Provencher, responsable de l'expérience développeur chez OpenAI, explique que les modèles comprennent mieux les nuances et les ambiguïtés, et que des instructions excessivement précises, autrefois utiles, peuvent désormais nuire aux résultats. Le guide demande de donner au modèle un cahier des charges clair : le résultat souhaité, à qui il est destiné, le contexte et les contraintes pertinents, et ce qui compte comme terminé. Les descriptions des skills doivent être courtes et claires, en précisant quand ils doivent s'exécuter. Des limites de décision explicites doivent remplacer les règles générales du type « demande-moi d'abord ». Et « terminé » signifie mettre en œuvre le changement, l'exécuter, vérifier le résultat et corriger les échecs.
Conçu pour des tâches de plusieurs heures à plusieurs jours
La famille GPT-6 peut prendre en charge des tâches durant de plusieurs heures à plusieurs jours. Côté API, la Responses WebSocket API permet de réorienter le modèle pendant qu'il travaille ; les mises à jour sont mises en file d'attente et n'annulent pas un outil en cours d'exécution. Pendant qu'un outil lent tourne, le modèle peut d'abord accomplir le travail qui n'en dépend pas. GPT-6.1 Sol peut aussi confier des sous-tâches indépendantes à des sous-agents en parallèle dans la Responses API, le multi-agent étant actuellement en beta. Les trois modèles peuvent opérer directement des sites web et des applications de bureau (computer use), avec un principe : choisir à chaque étape la méthode la plus fiable et la plus simple, et quand une tâche peut être accomplie via une API ou un outil connecté, ne pas lire l'écran et cliquer sur des boutons.
Des cas d'équipes fournissent des repères. Cognition a utilisé Astra pour retracer et vérifier de bout en bout, sans aucune information préalable et en 30 minutes, la correction d'un bug de paiement impliquant 5000 dollars en espèces et 200 000 de crédits API. Harvey a utilisé Astra avec des journaux d'audit pour tester un agent juridique sur un corpus de près de 8000 documents. Invideo a utilisé Astra pour des tâches d'étalonnage et de correction des couleurs et a environ triplé son taux de réussite.
Une réserve : le guide ne publie pas la longueur des fenêtres de contexte des trois modèles, si bien que les équipes qui prévoient des contextes très longs devront attendre des informations complémentaires. Pour les équipes qui choisissent maintenant, la valeur de ce guide est de transformer la décision : passer de « prendre le plus fort » à « choisir par couche de tâche » — Luna pour contenir les coûts quotidiens, Sol pour le travail complexe, Astra pour les problèmes vraiment difficiles, avec les niveaux de raisonnement et le cache en complément pour garder les dépenses totales sous contrôle.