ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Ultrafast API: Hinweise auf Erweiterung — OpenAI-Dokumente zeigen drei Geschwindigkeitsstufen

Ultrafast API: Hinweise auf Erweiterung — OpenAI-Dokumente zeigen drei Geschwindigkeitsstufen

KI-Informationen • Admin • • 6 Aufrufe

Ultrafast API ist die Inferenz-Stufe mit extrem niedriger Latenz, die OpenAI im August zusammen mit GPT-5.6 Sol eingeführt hat — offiziell bis zu 750 Token pro Sekunde, 14-mal schneller als die Standard-Stufe. Am 26. September entdeckten Entwickler Ultrafast-Verweise in den OpenAI-Platform- und API-Dokumenten; ein von imjustnewatai auf X veröffentlichter Screenshot zeigt „Ultrafast" in der Cloud-Agent-API-Dokumentation. TestingCatalog fand zudem eine versteckte Geschwindigkeitsauswahl im Responses API Playground: Standard, Fast und Ultrafast — derzeit noch ausgeblendet.

Kein neues Modell, sondern eine Geschwindigkeitsstufe

Ultrafast ist kein neues Modell, sondern eine Service-Stufe. Die API bot bisher Standard und Fast (Fast ist dokumentiert und per service_tier: "fast" wählbar); Ultrafast wäre die dritte und schnellste Stufe. Sie läuft auf Cerebras-Infrastruktur — OpenAI kündigte Anfang des Jahres eine 750-MW-Kapazitätspartnerschaft mit Cerebras an, die bis 2028 schrittweise aufgebaut wird. Aktuell ist Ultrafast nur für einen begrenzten Kundenkreis verfügbar, GPT-5.6 Sol ist das einzige bestätigte unterstützte Modell.

Was das für Entwickler bedeutet

Die praktische Änderung: Latenz lässt sich künftig stufenweise einkaufen. Latenzempfindliche Workloads — Support-Chat, Echtzeit-Sprache, Code-Vervollständigung, Handelsrisikoprüfung — zwangen bisher zur Wahl zwischen kleineren Modellen für Tempo und größeren Modellen mit Verzögerung. Mit drei Stufen können Teams jedem Workload die Latenz zuordnen, die er tatsächlich wert ist, und teure Inferenz auf die Pfade konzentrieren, die Umsatz oder Nutzererlebnis bewegen. Die Staffelung von Geschwindigkeit macht Latenz zudem zum erstklassigen Bürger der API-Ökonomie — Anwendungsarchitekturen brauchen Latenzbudgets.

Drei offene Fragen

Erstens: Der OpenAI DevDay ist am 29. September, eine Ankündigung dort ist nicht ausgeschlossen — aber unbestätigt. Zweitens ist unklar, ob die GPT-6-Familie (Sol, Astra) Ultrafast unterstützen wird. Drittens der Preis — OpenAI hat den Ultrafast-Aufschlag nicht genannt.

Dass Dokumente und ein Playground-Schalter gleichzeitig auftauchen, deutet auf eine koordinierte Aufwärmphase hin, nicht auf ein versehentliches Leck. Für Entwickler heißt die echte Vorbereitung nicht, auf einen Schalter zu warten, sondern Latenzbudgets pro Workload zu planen: Welche Pfade sind Millisekunden wert, welche nicht. Antworten gibt es am 29. September beim DevDay; bis dahin bleibt es ein unbestätigter Bericht.

Empfohlene Tools

Mehr