Am 22. September 2026 hat OpenAI in seinem offiziellen Blog – im Beitrag "Better prompt caching for GPT-6" – ein verbessertes Prompt-Caching-System für die GPT-6-Familie sowie neue Tools zur Überwachung und Diagnose der Cache-Leistung vorgestellt.
Zunächst: Was hat sich konkret geändert? Die GPT-6-Modelle erzielen standardmäßig höhere Cache-Trefferquoten: Für berechtigte gemeinsame Präfixe, die innerhalb eines 30-Minuten-Fensters wiederverwendet werden, gibt es bis zu 90 % Rabatt auf gecachte Eingabe-Tokens. OpenAI hat außerdem ein Prompt Caching Dashboard gestartet, das Trefferquoten im Zeitverlauf verfolgt und per Eingabe-Kompositionsdiagramm gecachte und nicht gecachte Tokens vergleicht – so lassen sich Einbrüche der Trefferquote aufspüren. Bei einem unerwarteten Cache-Miss vergleicht das neue Diagnose-Tool die Anfrage mit einer kürzlichen erfolgreichen Antwort, zeigt auf, ob Modell, Tools, Einstellungen oder Eingabe die Wiederverwendung verhindert haben, und schätzt die Zahl der betroffenen Tokens.
Die zwei Änderungen, die Agent-Entwickler am meisten freuen dürften
Erstens lassen sich jetzt explizite Cache-Präfix-Breakpoints setzen: Entwickler bestimmen selbst, welche Prompt-Teile gecacht werden und wo das gecachte Segment beginnt und endet. Zweitens führt das Anpassen der Reasoning-Stärke (reasoning effort) oder das Hinzufügen und Entfernen von Tools nicht mehr automatisch zur Ungültigkeit des zuvor gecachten Kontexts. OpenAIs Begründung: GPT-6 ist für dauerhaft laufende Agenten gebaut – vom Refactoring ganzer Codebasen bis zur Erstellung recherchierter Dokumente. Solche Anwendungen feuern ganze Sequenzen von API-Anfragen ab, die stets dieselben Anweisungen, Tool-Definitionen und denselben Kontext mitschleppen. Caching bedeutet im Kern, dass wiederholt gesendete Inhalte nur einmal bezahlt werden.
Für wen sich die Rechnung am meisten lohnt
OpenAI zitiert GitHub-Daten: In den vergangenen Monaten hätten die Caching-Verbesserungen den Anteil der Prompt-Tokens, die neu verarbeitet werden mussten, über Milliarden von Anfragen hinweg um mehr als 50 % gesenkt – und Copilot antworte schneller. Für Teams mit mehrstufigen Dialogen, Dokumenten-Pipelines oder Agent-Systemen sind Eingabe-Tokens ohnehin der größte Kostenblock; 90 % Rabatt auf gecachte Reads schlagen direkt auf die Rechnung durch. Aber Vorsicht bei den Grenzen: Der Rabatt gilt nur für berechtigte gemeinsame Präfixe innerhalb des 30-Minuten-Fensters, Ausgabe-Tokens sind ausgenommen. Wer mit kurzen Prompts und einmaligen Q&A arbeitet, profitiert nur begrenzt vom Caching. Wer wirklich sparen will, muss Prompt-Strukturen mit Dashboard und Diagnose-Tool optimieren – bloßes Einschalten genügt nicht.