ToolNavs AIツールナビ
ツール投稿 ログイン
戻るAI情報
MetaがMetaRoCEをオープン:AIクラスターネットワークがパケットロスとマルチパスの再構築を開始

MetaがMetaRoCEをオープン:AIクラスターネットワークがパケットロスとマルチパスの再構築を開始

AI情報 Admin 52 回閲覧

2026年8月24日、Meta EngineeringはMetaRoCEをリリースし、大規模なAIトレーニングと推論向けに再設計されたRDMA伝送ソリューションであると主張しました。 エンドポイントインテリジェンス、パステレメトリー、パケットロスリカバリ機能を使って、通常のイーサネット上でGPUクラスターのスループットを維持しようと試みます。 Metaは10月にOpen Compute Projectを通じてプロトコル仕様、参照ソフトウェア実装、コンプライアンステストスイートを公開する予定であり、この発表はアーキテクチャとエコシステムの出発点となります。

なぜMetaがトランスポートレイヤーを再構築するのか

従来のRoCEはパケットロスを減らすためにスイッチ側の優先フロー制御に依存していますが、AIクラスターのトラフィックは訓練段階で急速に変化します。 一時停止フレームは混雑をより多くのデバイスに広げる可能性があり、固定ルールはマルチパスネットワークへの適応が困難です。 勾配や活性化テンソルが遅れた場合、GPUグループ全体が待機する可能性があります。

MetaRoCEは送信側と受信側の両方により多くの判断を下します。 エンドポイントは各パスの往復遅延、ECNタグ付け、利用率を収集し、動的にデータを割り当てます。 また、このソリューションはアウトオブオーダー配信、ネイティブのマルチパス、PFCの一時停止フレームに依存しないパケットロス許容性もサポートしています。 目的は、ネットワークが常に完璧であると仮定することではなく、ローカル障害が発生した際に通信を継続させることです。

3つのデザインがどのように連携して待ち時間を減らすか

マルチパスは複数のリンクを利用して単一のホットスポットを削減できます。 順番外配達とは、到着したデータが最も遅い荷物を待つ必要がないことを意味します。 送信者と受信者の双方が輻輳制御に参加し、これにより輻輳経路率を減らし、追加の容量を持つ経路へトラフィックをリダイレクトできます。

Metaは、既存のRDMA動詞やほとんどの上位層ソフトウェアは大きな変更を必要としないと述べています。 チームはAMD Pensandoネットワークカードと64ノードのAMD GPUクラスターで検証しています。 同社の発表された結果によると、1%のパケットロスでも約86%のスループットが達成され、10%のパケットロスでも利用可能な帯域幅が保持されていました。 これらはMetaの管理された実験結果であり、どのデータセンターの保証とみなすことはできません。

これはAIインフラにとって何を意味するのでしょうか?

標準、ネットワークカードのファームウェア、スイッチ、監視ツールが連携すれば、AIクラスターは「ほぼゼロのパケット損失」と交換するために大量の静的ルールを犠牲にする必要がなくなるかもしれません。 ネットワークはエンドポイントのフィードバックに基づいて自己調整できる計算資源のようなものになり、トポロジーを超えたトレーニングジョブの拡張が容易になります。

展開の閾値は依然として高いため、チームはネットワークカードやスイッチのサポートおよびドライバーが通信ライブラリと互換性があることを確認し、故障注入とスループットのベースラインを再構築しなければなりません。 OCP仕様とテストスイートのリリース前は、MetaRoCEは現在のRoCEを置き換えるソリューションというよりも、価値あるインフラの方向性として見なされる方が適しています。

関連記事

Apple M6およびM5 Ultraが発売:ローカルAIの計算能力が統合メモリを巡って競争を始める

Apple M6およびM5 Ultraが発売:ローカルAIの計算能力が統合メモリを巡って競争を始める

2026年8月25日、AppleはプレスリリースでM6およびM5 Ultraを発表し、単に新世代へのチップ切り替えだけでなく、メモリ容量、帯域幅、ニューラルネットワークコンピューティングの組み合わせに...

小鵬のロボティクス事業が9億ドル以上の資金調達を確定:物理的AIが量産カウントダウンに入る

小鵬のロボティクス事業が9億ドル以上の資金調達を確定:物理的AIが量産カウントダウンに入る

2026年8月25日、XPengはロボティクス事業が9億ドル以上の資金調達を完了し、投資後の評価額は63億ドルを超えたと正式に発表しました。同社は、これが中国の具身型知能分野で最大級の単独プライベート...

騰訊 Hunyuan Hy4 プレビュー オープンソース:770B パラメータ、100万コンテキスト リアル生産性をターゲットに

騰訊 Hunyuan Hy4 プレビュー オープンソース:770B パラメータ、100万コンテキスト リアル生産性をターゲットに

騰訊環源は Hy4プレビュー をリリースし、オープンソース化しました。この新世代の旗艦MoE大型モデルは、総パラメータが770B、トークン1回あたり49B、ネイティブコンテキスト長が1MBに延長されて...

ZhipuのオープンソースGLM-5.3-Flash、320BモデルはAI価格を新たな低値まで押し上げました

ZhipuのオープンソースGLM-5.3-Flash、320BモデルはAI価格を新たな低値まで押し上げました

Zhipu(Z.ai)は GLM-5.3-Flash (320B-A18B)を正式に発売し、オープンソース化しました。 GLM-5シリーズ初のネイティブマルチモーダルモデルであり、1Mトークンコンテキ...

おすすめツール

もっと見る