ToolNavs 便利なAIツールを発見
ツール投稿 ログイン
戻るAI情報
GLM-5.3-FlashXのローンチ:最大200トークン/秒、Zhipuが大規模モデル競争をインフラに押し込む

GLM-5.3-FlashXのローンチ:最大200トークン/秒、Zhipuが大規模モデル競争をインフラに押し込む

AI情報 Admin 1 回閲覧

Zhipuは正式に GLM-5.3-FlashXを発表し、最大推論速度200トークン/秒、API同時開局、モデルキーGLM-5.3-FlashXを搭載しました。既存のGLM-5.3-Flashと比べて、新バージョンは約5倍の速度で、価格は2.5倍の値上げとなっています。AIモデル間の競争は「誰がより賢いか」から「誰が安定してより速く、より安価に出力できるか」へと移行しています。

Ox AlphaからFlashXへ

GLM-5.3-Flashは以前、 Ox Alpha として匿名でOpenCodeおよびOpenRouterにログインしていました。Z.ai、ローンチから1週間以内にこのモデルは2大プラットフォームで最も頻繁にアクセスされるモデルの一つとなり、6日間で62兆トークン以上のトークンを処理し、高い同時実行要件が推論インフラに直接圧力をかけていることが明らかになりました。

より大きなモデルの再学習と比べると、FlashXは本番環境の「パフォーマンスレイヤー」のようなもので、Flashシリーズの能力ポジショニングを維持しつつ、出力スループットを200トークン/秒に増加させ、コーディングエージェント、リアルタイム会話、ツール呼び出しを可能にして待ち時間を短縮します。

10万台の国内チップがより高速な推論をサポートします

速度は単に機械数を増やすことだけではありません。志浦によれば、GLM-5.3-Flashの生産推論は10万台以上の国内生産AIアクセラレータチップのクラスター上で動作しており、推論システムはメモリ、帯域幅、新しいモデルアーキテクチャに合わせて再構築されていると述べています。

公式な最適化には、W8A8クオンタイズ、混合精度キャッシュ、レイヤースプリット、エンコード・プリフィル・デコードのデカップリングアーキテクチャが含まれます。複数回の最適化を経て、同じハードウェア上でエンドツーエンドのサービス性能は初期バージョンの約3倍向上します。

大型モデル競技はインフラ段階に入りました

FlashXは速度をより高価なAPI層にし、「低遅延」として価格設定しています。企業の場合、エージェントが取るすべてのステップはモデルの返還を待つ必要があり、トークン/sはタスクチェーンを数十秒から対話可能な範囲に圧縮できるかどうかを直接決定します。

モデル能力のギャップが縮まるにつれて、推論エンジン、チップ適応、クラスタスケジューリング、ユニットあたりのコストが新たな課題となるでしょう。GLM-5.3-FlashXの意義は単なる200トークン/秒の指標にとどまらず、国内の計算能力が大規模な実世界呼び出しを行い、インフラ最適化を製品の差別化に直接翻訳し始めていることにあります。

おすすめツール

もっと見る