ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Informations sur l’IA
Ultrafast API : des signaux d'extension — les docs OpenAI révèlent trois niveaux de vitesse

Ultrafast API : des signaux d'extension — les docs OpenAI révèlent trois niveaux de vitesse

Informations sur l’IA • Admin • • 6 vues

Ultrafast API est le niveau d'inférence à très faible latence qu'OpenAI a lancé en août aux côtés de GPT-5.6 Sol — officiellement jusqu'à 750 tokens par seconde, 14 fois plus rapide que le niveau Standard. Le 26 septembre, des développeurs ont repéré des mentions d'Ultrafast dans les docs de la Platform et de l'API OpenAI ; une capture publiée par imjustnewatai sur X montre « Ultrafast » dans la documentation de l'API cloud agent. Par ailleurs, TestingCatalog a détecté un sélecteur de vitesse masqué en préparation dans le Responses API Playground : Standard, Fast, Ultrafast — pour l'instant caché.

Pas un nouveau modèle, un niveau de vitesse

Ultrafast n'est pas un nouveau modèle, mais un niveau de service. L'API proposait déjà Standard et Fast (Fast est documenté, sélectionnable via service_tier: "fast" dans les requêtes) ; Ultrafast serait le troisième et le plus rapide. Il tourne sur l'infrastructure Cerebras — OpenAI a annoncé en début d'année un partenariat de capacité de 750 MW avec Cerebras, déployé par phases jusqu'en 2028. Aujourd'hui, Ultrafast n'est ouvert qu'à un cercle restreint de clients, GPT-5.6 Sol étant le seul modèle confirmé.

Ce que cela change pour les développeurs

Le changement concret : la latence s'achètera par niveau. Les charges sensibles à la latence — chat support, voix temps réel, complétion de code, contrôle des risques de trading — imposaient jusqu'ici un arbitrage entre petits modèles pour la vitesse et grands modèles au prix du délai. Avec trois niveaux, les équipes pourront associer à chaque charge utile la latence qu'elle vaut réellement, et réserver l'inférence coûteuse aux chemins qui font bouger le revenu ou l'expérience. La tarification de la vitesse fait aussi de la latence un citoyen de première classe de l'économie des API — les architectures devront budgéter la latence.

Trois questions en suspens

D'abord, l'OpenAI DevDay a lieu le 29 septembre, et une annonce d'extension y est envisageable — mais rien n'est confirmé. Ensuite, on ignore si la famille GPT-6 (Sol, Astra) prendra en charge Ultrafast. Enfin, le prix — OpenAI n'a pas dévoilé la prime Ultrafast.

La parution simultanée de documents et d'un interrupteur Playground suggère un teasing coordonné, pas une fuite accidentelle. Pour les développeurs, la vraie préparation n'est pas d'attendre un interrupteur, mais de commencer à budgéter la latence par charge de travail : quels chemins valent des millisecondes, lesquels non. Réponses le 29 septembre au DevDay ; d'ici là, cela reste une information non confirmée.

Outils Recommandés

Plus