GPT-6 Luna (Max) a fait tomber le coût d'une tâche d'agent à 5 centimes. Le 28 septembre, le compte officiel d'Arena a annoncé que ce modèle léger était entré dans le classement Agent Arena à la 23e place, avec une amélioration nette de +1,6 % — sur la base de 8 000 conversations d'agents réelles, soit six places de mieux que la génération précédente GPT-5.6 Luna (xHigh). Pour OpenAI, c'est une validation publique que « pas cher » peut aussi vouloir dire « bon ».
Ce que 5 centimes veulent dire en contexte
Une comparaison éclaire les choses : le flagship Sol (Max) de la même famille GPT-6 est 6e de l'Agent Arena à environ 0,76 dollar par tâche. Pour des agents qui doivent tourner 24 h/24 — questions-réponses du support client, nettoyage de données, surveillance continue, traitement de contenu par lots — 70 centimes économisés par tâche représentent des centaines de milliers de dollars par jour à un million d'exécutions. La valeur d'un modèle léger dans un classement n'a jamais résidé dans son rang absolu, mais dans le fait d'occuper une position dans le quadrant « assez bon et pas cher ». Lecture associée
La division du travail de la gamme OpenAI prend forme
Le positionnement de Luna est clair depuis son lancement : les chiffres officiels montrent une progression de 5,4 points par rapport à la génération précédente au niveau de raisonnement élevé, avec un coût par tâche réduit de 58 %. Ce résultat de +1,6 % à l'Agent Arena (amélioration nette par rapport au modèle moyen) confirme encore son rôle — non pas défier les flagships au sommet, mais devenir l'option par défaut sur la voie du « déploiement à grande échelle ». Sol prouve le plafond technique d'OpenAI ; Luna porte les agents dans chaque scénario sensible au prix.
Cette division du travail se reflète aussi dans les tendances des classements : les modèles légers grimpent régulièrement dans les classements de terrain comme l'Agent Arena grâce à leur efficacité-coût, tandis que les flagships défendent leur position dans les classements de capacité comme la Text Arena. Ces deux lignes parallèles montrent que la compétition sur le marché des grands modèles s'est stratifiée — plafond et échelle deviennent deux activités distinctes.
Pour qui c'est fait, pour qui ça ne l'est pas
Si vous déployez des tâches d'agents à haute fréquence, peu complexes et tolérantes aux pannes, des modèles comme Luna (Max) méritent une évaluation prioritaire : un changement de coût d'un ordre de grandeur redessine directement la frontière des tâches qui « valent la peine d'être automatisées ». Mais pour les tâches complexes de longue durée — raisonnement en plusieurs étapes, orchestration de chaînes d'outils, scénarios où un seul échec coûte cher — les +1,6 % de la 23e place rappellent aussi : c'est seulement « légèrement au-dessus de la moyenne », et les modèles flagships restent le choix le plus sûr. Pas cher est un avantage, pas une panacée.