Le 22 septembre 2026, OpenAI a annoncé sur son blog officiel – dans un article intitulé « Better prompt caching for GPT-6 » – un système de mise en cache des prompts amélioré pour la famille GPT-6, ainsi que de nouveaux outils pour surveiller et diagnostiquer les performances du cache.
D'abord, ce qui a réellement changé. Les modèles GPT-6 obtiennent désormais des taux de réussite du cache plus élevés par défaut : les préfixes partagés éligibles réutilisés dans une fenêtre de 30 minutes bénéficient de remises allant jusqu'à 90 % sur les tokens d'entrée mis en cache. OpenAI a aussi lancé un tableau de bord « Prompt Caching Dashboard » qui suit les taux de réussite dans le temps et compare, via un graphique de composition des entrées, les tokens en cache et hors cache – de quoi repérer les chutes de performance. En cas d'échec inattendu du cache, le nouvel outil de diagnostic compare la requête à une réponse récente réussie, identifie si c'est le modèle, les outils, les paramètres ou l'entrée qui a empêché la réutilisation, et estime le nombre de tokens concernés.
Les deux changements que les développeurs d'agents apprécieront le plus
Premièrement, il est désormais possible de définir des points d'arrêt explicites pour les préfixes en cache : les développeurs décident eux-mêmes quelles parties du prompt sont mises en cache, et où le segment commence et se termine. Deuxièmement, ajuster l'effort de raisonnement (reasoning effort) ou ajouter/retirer des outils n'invalide plus automatiquement le contexte précédemment mis en cache. L'explication d'OpenAI : GPT-6 est conçu pour des agents persistants – de la refactorisation de bases de code à la production de documents de recherche. Ces applications enchaînent des séquences de requêtes API qui transportent toujours les mêmes instructions, définitions d'outils et contexte. La mise en cache, au fond, c'est payer une seule fois un contenu envoyé en boucle.
Pour qui le calcul est le plus avantageux
OpenAI cite des données GitHub : ces derniers mois, les améliorations du cache ont réduit de plus de 50 % la part des tokens de prompt nécessitant un nouveau traitement, sur des milliards de requêtes – et Copilot répond plus vite. Pour les équipes qui font tourner des conversations multi-tours, des pipelines documentaires ou des systèmes d'agents, les tokens d'entrée représentent déjà le gros de la facture ; 90 % de remise sur les lectures en cache se répercute directement. Mais attention aux limites : la remise ne s'applique qu'aux préfixes partagés éligibles dans la fenêtre de 30 minutes, les tokens de sortie sont exclus. Si votre application se limite à des prompts courts et des Q&A ponctuels, le dividende du cache restera modeste. Pour vraiment économiser, il faudra optimiser la structure des prompts avec le tableau de bord et l'outil de diagnostic – l'activer ne suffit pas.