Die GPT-6-Familie wirft eine praktische Auswahlfrage auf, und OpenAI hat sie in seinem offiziellen Leitfaden A model guide for the GPT-6 family, veröffentlicht am 2. Oktober 2026, systematisch beantwortet. Der Leitfaden listet nicht nur die Preise von drei Stufen auf. Er behandelt Reasoning-Stufen, Prompt-Caching, Prompting und die Steuerung langer Aufgaben zusammen und gibt Entwicklungsteams eine Methode, Kosten und Leistungsfähigkeit als eine einzige Entscheidung zu konfigurieren.
Drei Stufen und ihre Preise
| Modell | Eingabe | Ausgabe | Cache-Eingabe | Positionierung |
|---|---|---|---|---|
| GPT-6 Astra | 10 US-Dollar | 50 US-Dollar | 1 US-Dollar | Die härteste Reasoning-Arbeit, wenn höchste Intelligenz nötig ist |
| GPT-6.1 Sol | 2 US-Dollar | 10 US-Dollar | 0,10 US-Dollar | Intelligenz nahe an Astra zu einem Fünftel des Preises |
| GPT-6 Luna | 0,10 US-Dollar | 0,50 US-Dollar | 0,01 US-Dollar | Klar definierte, repetitive Alltagsarbeit im großen Maßstab |
Alle Preise gelten pro Million Token. GPT-6.1 Sol eignet sich für komplexe Programmierung, Forschung und Computer Use. GPT-6 Luna zielt auf wiederholbare Aufgaben wie das Extrahieren von Rechnungsfeldern, das Klassifizieren von Anfragen und das Erstellen strukturierter Zusammenfassungen. Da die Abstände zwischen den Stufen bis zum Hundertfachen reichen, vervielfacht ein falsch gewähltes Modell die Kosten unmittelbar.
Modell und Reasoning-Stufe gemeinsam wählen
Das Kernprinzip lautet, Modellauswahl und Reasoning-Stufe gemeinsam als Abwägung zwischen Intelligenz und Preis zu betrachten. Low eignet sich für Routinearbeit wie das Extrahieren von Fakten und kleine Änderungen. Medium eignet sich für Arbeit, die Urteilsvermögen verlangt, etwa das Planen einer Funktion oder den Vergleich von Optionen. High eignet sich für schwieriges Debugging, tiefgehende Analyse und sorgfältige Prüfung. Extra high und Max sollten nur getestet werden, wenn High nicht ausreicht, und nur bleiben, wenn die Verbesserung die zusätzliche Zeit und die zusätzlichen Kosten wert ist. Teams sollten nicht standardmäßig alles auf die höchste Stufe stellen, sondern nach Schwierigkeit der Aufgabe verteilen.
Prompt-Caching und Kontextverwaltung
Gecachte Eingaben können bis zu 95 % günstiger sein als nicht gecachte. Der Leitfaden empfiehlt, stabile Anweisungen und Referenzmaterial vor die wechselnden Aufgabendetails zu stellen und Werkzeugdefinitionen konsistent zu halten, um die Cache-Treffer zu erhöhen. In langen Gesprächen kann Compaction den Kontext komprimieren und zugleich den Zustand bewahren, der zum Weiterarbeiten nötig ist, damit lange Aufgaben nicht immer teurer und langsamer werden.
Die Art zu prompten verändert sich
Eric Provencher, OpenAIs Verantwortlicher für die Entwicklererfahrung, sagt, Modelle seien besser darin geworden, Nuancen und Mehrdeutigkeiten zu verstehen, und übermäßig konkrete Anleitungen, die früher halfen, könnten Ergebnisse nun behindern. Der Leitfaden verlangt ein klares Briefing für das Modell: das gewünschte Ergebnis, für wen es bestimmt ist, der relevante Hintergrund samt Einschränkungen und was als erledigt gilt. Beschreibungen von Skills sollten kurz und klar sein und angeben, wann sie laufen. Klare Entscheidungsgrenzen sollten pauschale Regeln wie „frag mich zuerst" ersetzen. Und „erledigt" umfasst, die Änderung umzusetzen, sie auszuführen, das Ergebnis zu prüfen und Fehler zu beheben.
Gebaut für Aufgaben von Stunden bis Tagen
Die GPT-6-Familie kann Aufgaben übernehmen, die Stunden bis Tage dauern. Auf API-Seite erlaubt die Responses WebSocket API, das Modell während der Arbeit umzusteuern; Aktualisierungen werden in die Warteschlange gestellt und brechen ein laufendes Werkzeug nicht ab. Während ein langsames Werkzeug läuft, kann das Modell zunächst Arbeit erledigen, die nicht von ihm abhängt. GPT-6.1 Sol kann in der Responses API auch unabhängige Teilaufgaben parallel an Sub-Agenten vergeben; Multi-Agent ist derzeit in der Beta. Alle drei Modelle können Websites und Desktop-Anwendungen direkt bedienen (Computer Use), mit einem Prinzip: In jedem Schritt die zuverlässigste und einfachste Methode wählen, und wenn sich etwas per API oder verbundenem Werkzeug erledigen lässt, nicht den Bildschirm lesen und Schaltflächen anklicken.
Beispiele von Teams liefern Anhaltspunkte. Cognition nutzte Astra, um ohne jede Vorinformation innerhalb von 30 Minuten die Behebung eines Zahlungs-Bugs, bei dem es um 5000 US-Dollar in bar und 200.000 API-Guthaben ging, Ende zu Ende nachzuverfolgen und zu verifizieren. Harvey testete mit Astra und Audit-Logs einen Rechts-Agenten auf einem Korpus von fast 8000 Dokumenten. Invideo setzte Astra für Farbkorrektur-Aufgaben ein und verdreifachte seine Erfolgsquote in etwa.
Ein Vorbehalt: Der Leitfaden veröffentlicht die Längen der Kontextfenster der drei Modelle nicht, sodass Teams, die sehr lange Kontexte planen, auf weitere Informationen warten müssen. Für Teams, die jetzt auswählen, liegt der Wert des Leitfadens darin, die Entscheidung von „nimm das Stärkste" zu „wähle nach Aufgabenschicht" zu verändern: Luna, um Alltagskosten niedrig zu halten, Sol für komplexe Arbeit, Astra für wirklich harte Probleme, ergänzt um Reasoning-Stufen und Caching, damit die Gesamtausgaben kontrollierbar bleiben.