ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI-Informationen
Prime Inference startet: Inferenzdienst für führende offene Modelle, Stabilität ist der Wettbewerb

Prime Inference startet: Inferenzdienst für führende offene Modelle, Stabilität ist der Wettbewerb

KI-Informationen • Admin • • 9 Aufrufe

Prime Inference wurde am 2. Oktober 2026 von Prime Intellect offiziell veröffentlicht und ist ein Inferenzdienst für führende offene Modelle. In mehreren Rechenzentren bietet er auf eigener GPU-Infrastruktur sowohl serverlose Endpunkte als auch reservierte Kapazität, mit produktionsreifen SLAs, Sicherheits- und Datenschutzkonzept, einheitlicher Abrechnung und Nutzungsverfolgung auf Teamebene, Unterstützung für automatisches Failover zwischen Rechenzentren und einer Aufrufmethode, die mit dem OpenAI-Schnittstellenformat kompatibel ist.

Erst im eigenen Haus bewährt, dann nach außen verkauft

Prime Inference war ursprünglich die interne Plattform von Prime Intellect, die Rollouts für Reinforcement Learning im großen Maßstab, die Erzeugung synthetischer Daten, Evaluierungen und lang laufende Programmier-Agenten trug, intern täglich fast eine Billion Token verarbeitete und seit Januar 2026 auch groß angelegte Produktionseinsätze für Kunden übernimmt. Die erste öffentliche Bereitstellung ist GLM-5.3, am 22. September auf OpenRouter gestartet, dort einer der schnellsten GLM-5.3-Endpunkte, mit einer Fehlerrate bei Tool-Aufrufen nahe null und seit dem Start 100 % Verfügbarkeit.

Die Basis ist Blackwell, der Software-Stack voller bekannter Namen

Aktuell läuft der Dienst auf NVIDIA Blackwell, die nächste Generation Vera Rubin folgt in Kürze. Auf der Softwareseite kombiniert er NVIDIA Dynamo, vLLM, Mooncake und FlashInfer, arbeitet eng mit Inferact und NVIDIA zusammen und gibt Verbesserungen an die Upstream-Open-Source-Projekte zurück. Zur Einordnung solcher Grundlagen siehe Für welche Teams eignet sich vLLM? Es ist eine leistungsstarke Inferenzbasis, kein Chatprodukt, das sofort nach der Installation funktioniert.

Die technischen Zahlen sprechen für sich: Die Trennung von Prefill und Decoding auf verschiedene GPU-Gruppen senkte die p90-Latenz zwischen Token um fast 40 %; die Halbierung des Prefill-Token-Budgets pro Schritt von 8K auf 4K senkte die mittlere Wartezeit in der Warteschlange von 550 Millisekunden auf 110 Millisekunden und verkürzte die mittlere Zeit bis zum ersten Token um etwa 20 %; und die Komprimierung des KV-Cache mit NVFP4 verringerte jede Zeile von 576 Byte auf 352 Byte, wodurch die Cache-Kapazität bei gleichem Speicher um etwa 50 % stieg, von etwa 1,09 Millionen Token pro Decoder auf 1,63 Millionen Token. Bei einem Ziel von 100 Token pro Sekunde und Nutzer und einem Prefill-zu-Decode-Verhältnis von 1:4 kann jede Prefill-Gruppe 66 gleichzeitige Sitzungen bedienen.

Bei Agenten-Workloads geht es längst nicht mehr nur um Rechenleistung

Agenten-Workloads zeichnen sich durch lange Kontexte und die wiederholte Wiederverwendung des Verlaufs über mehrere Runden aus, sodass der Flaschenhals bei Inferenzdiensten zunehmend im Caching und in der Ablaufplanung liegt und nicht nur in der Rechenleistung selbst. Offene Modellgewichte bedeuten nicht, dass ein Modell direkt in Produktion gehen kann; Unternehmen brauchen weiterhin Nutzungsverfolgung, Failover und eine Verfügbarkeitszusage, für die jemand verantwortlich ist. Prime Inference macht all das zu einer verwalteten Schicht mit SLAs – genau das Stück, das offenen Modellen auf dem Weg in die Produktion gefehlt hat.

Empfohlene Tools

Mehr