Prime Inference は2026年10月2日、Prime Intellect によって正式に公開された、最先端のオープンモデル向け推論サービスです。複数のデータセンターで自社の GPU インフラを使い、サーバーレスエンドポイントと予約容量の2つの形態を提供し、本番レベルの SLA、セキュリティとプライバシーの設計、統一請求とチーム単位の利用量追跡を備え、データセンター間の自動フェイルオーバーに対応し、呼び出し方法は OpenAI インターフェース形式と互換性があります。
まず自社で動かし、それから外へ売る
Prime Inference はもともと Prime Intellect の自社用プラットフォームで、大規模な強化学習の rollout、合成データ生成、評価、長時間稼働するプログラミングエージェントを支え、社内で1日あたり約1兆 token を処理し、2026年1月からは顧客向けの大規模な本番デプロイも担ってきました。初の公開デプロイは GLM-5.3 で、9月22日に OpenRouter で公開され、そこで最も高速な GLM-5.3 エンドポイントの1つとなり、ツール呼び出しのエラー率はほぼゼロ、公開以来100%の可用性を維持しています。
土台は Blackwell、ソフトウェアスタックはおなじみの顔ぶれ
現在は NVIDIA Blackwell 上で稼働し、次世代の Vera Rubin がまもなく続きます。ソフトウェア面では NVIDIA Dynamo、vLLM、Mooncake、FlashInfer を組み合わせ、Inferact と NVIDIA と緊密に連携し、改善を上流のオープンソースプロジェクトへ還元しています。こうした土台の位置づけについては、vLLM はどんなチームに向いているのか?高性能な推論の土台であり、入れてすぐ使えるチャット製品ではない も参考になります。
工学的な数字が実力を物語ります。プリフィルとデコードを異なる GPU グループに分離したことで、p90 の token 間レイテンシが約40%低下しました。ステップごとのプリフィル token 予算を8Kから4Kへ半減させると、待ち行列の中央値は550ミリ秒から110ミリ秒に下がり、最初の token までの時間の中央値も約20%短縮しました。さらに NVFP4 で KV キャッシュを圧縮し、1行あたり576バイトから352バイトへ減らしたことで、同じメモリでのキャッシュ容量が約50%増え、デコーダあたり約109万 token から163万 token へ増えました。ユーザーあたり毎秒100 token を目標とした場合、プリフィルとデコードの比率1:4で、プリフィルグループ1つあたり66の同時セッションに対応できます。
エージェントの負荷で競うのは、もはや計算能力だけではない
エージェントの負荷の特徴は、長いコンテキストと、履歴を何度も再利用するマルチターン対話であり、推論サービスのボトルネックは計算能力そのものよりも、キャッシュとスケジューリングに移りつつあります。モデルの重みがオープンであることと、そのまま本番環境に入れられることは別であり、企業には利用量追跡、フェイルオーバー、責任の所在が明確な可用性の約束がまだ必要です。Prime Inference はそれらを SLA 付きのマネージド層として提供しており、まさにオープンモデルが本番へ進む際に欠けていた部分です。