2026年8月24日、Meta EngineeringはMetaRoCEをリリースし、大規模なAIトレーニングと推論向けに再設計されたRDMA伝送ソリューションであると主張しました。 エンドポイントインテリジェンス、パステレメトリー、パケットロスリカバリ機能を使って、通常のイーサネット上でGPUクラスターのスループットを維持しようと試みます。 Metaは10月にOpen Compute Projectを通じてプロトコル仕様、参照ソフトウェア実装、コンプライアンステストスイートを公開する予定であり、この発表はアーキテクチャとエコシステムの出発点となります。
なぜMetaがトランスポートレイヤーを再構築するのか
従来のRoCEはパケットロスを減らすためにスイッチ側の優先フロー制御に依存していますが、AIクラスターのトラフィックは訓練段階で急速に変化します。 一時停止フレームは混雑をより多くのデバイスに広げる可能性があり、固定ルールはマルチパスネットワークへの適応が困難です。 勾配や活性化テンソルが遅れた場合、GPUグループ全体が待機する可能性があります。
MetaRoCEは送信側と受信側の両方により多くの判断を下します。 エンドポイントは各パスの往復遅延、ECNタグ付け、利用率を収集し、動的にデータを割り当てます。 また、このソリューションはアウトオブオーダー配信、ネイティブのマルチパス、PFCの一時停止フレームに依存しないパケットロス許容性もサポートしています。 目的は、ネットワークが常に完璧であると仮定することではなく、ローカル障害が発生した際に通信を継続させることです。
3つのデザインがどのように連携して待ち時間を減らすか
マルチパスは複数のリンクを利用して単一のホットスポットを削減できます。 順番外配達とは、到着したデータが最も遅い荷物を待つ必要がないことを意味します。 送信者と受信者の双方が輻輳制御に参加し、これにより輻輳経路率を減らし、追加の容量を持つ経路へトラフィックをリダイレクトできます。
Metaは、既存のRDMA動詞やほとんどの上位層ソフトウェアは大きな変更を必要としないと述べています。 チームはAMD Pensandoネットワークカードと64ノードのAMD GPUクラスターで検証しています。 同社の発表された結果によると、1%のパケットロスでも約86%のスループットが達成され、10%のパケットロスでも利用可能な帯域幅が保持されていました。 これらはMetaの管理された実験結果であり、どのデータセンターの保証とみなすことはできません。
これはAIインフラにとって何を意味するのでしょうか?
標準、ネットワークカードのファームウェア、スイッチ、監視ツールが連携すれば、AIクラスターは「ほぼゼロのパケット損失」と交換するために大量の静的ルールを犠牲にする必要がなくなるかもしれません。 ネットワークはエンドポイントのフィードバックに基づいて自己調整できる計算資源のようなものになり、トポロジーを超えたトレーニングジョブの拡張が容易になります。
展開の閾値は依然として高いため、チームはネットワークカードやスイッチのサポートおよびドライバーが通信ライブラリと互換性があることを確認し、故障注入とスループットのベースラインを再構築しなければなりません。 OCP仕様とテストスイートのリリース前は、MetaRoCEは現在のRoCEを置き換えるソリューションというよりも、価値あるインフラの方向性として見なされる方が適しています。