Prime Inference a été officiellement publié par Prime Intellect le 2 octobre 2026 : c'est un service d'inférence destiné aux modèles ouverts de pointe. Dans plusieurs centres de données, sur sa propre infrastructure GPU, il propose à la fois des points de terminaison sans serveur et de la capacité réservée, avec des SLA de niveau production, une conception axée sur la sécurité et la confidentialité, une facturation unifiée et un suivi d'utilisation par équipe, la prise en charge du basculement automatique entre centres de données, et un mode d'appel compatible avec le format d'interface OpenAI.
D'abord éprouvé en interne, ensuite vendu à l'extérieur
Prime Inference était à l'origine la plateforme interne de Prime Intellect, qui prenait en charge des déploiements d'apprentissage par renforcement à grande échelle, la génération de données synthétiques, les évaluations et des agents de programmation fonctionnant sur de longues durées, traitant en interne près d'un billion de tokens par jour, et assurant depuis janvier 2026 des déploiements de production à grande échelle pour des clients. Son premier déploiement public est GLM-5.3, lancé le 22 septembre sur OpenRouter, l'un des points de terminaison GLM-5.3 les plus rapides de la plateforme, avec un taux d'erreur d'appel d'outils proche de zéro et une disponibilité de 100 % depuis son lancement.
Une base Blackwell, une pile logicielle aux noms familiers
Il fonctionne actuellement sur NVIDIA Blackwell, et la prochaine génération Vera Rubin suivra bientôt. Côté logiciel, il combine NVIDIA Dynamo, vLLM, Mooncake et FlashInfer, travaille en étroite collaboration avec Inferact et NVIDIA, et reverse ses améliorations aux projets open source en amont. Pour situer ce type de socle, voir À quelles équipes vLLM convient-il ? C'est un socle d'inférence haute performance, pas un produit de chat prêt à l'emploi dès l'installation.
Les chiffres d'ingénierie parlent d'eux-mêmes : la séparation du préremplissage et du décodage sur des groupes de GPU distincts a réduit la latence inter-token p90 de près de 40 % ; la réduction de moitié du budget de tokens de préremplissage par étape, de 8K à 4K, a fait passer l'attente médiane en file de 550 millisecondes à 110 millisecondes et réduit le temps médian jusqu'au premier token d'environ 20 % ; et la compression du cache KV avec NVFP4 a fait passer chaque ligne de 576 octets à 352 octets, augmentant la capacité de cache d'environ 50 % à mémoire égale, d'environ 1,09 million de tokens par décodeur à 1,63 million de tokens. Avec un objectif de 100 tokens par seconde et par utilisateur, et un ratio préremplissage/décodage de 1:4, chaque groupe de préremplissage peut servir 66 sessions simultanées.
Pour les charges des agents, tout ne se joue plus sur la puissance de calcul
Les charges des agents se caractérisent par de longs contextes et la réutilisation répétée de l'historique sur plusieurs tours, si bien que le goulot d'étranglement des services d'inférence se situe de plus en plus dans la mise en cache et l'ordonnancement, et pas seulement dans la puissance de calcul elle-même. Des poids de modèle ouverts ne signifient pas qu'un modèle peut entrer directement en production ; les entreprises ont encore besoin d'un suivi d'utilisation, d'un basculement en cas de panne et d'un engagement de disponibilité porté par un responsable. Prime Inference transforme tout cela en une couche gérée avec des SLA, exactement la pièce qui manquait aux modèles ouverts pour passer en production.