ToolNavs AI工具导航
提交工具 登录
返回AI资讯
Meta 开放 MetaRoCE:AI 集群网络开始为丢包和多路径重做

Meta 开放 MetaRoCE:AI 集群网络开始为丢包和多路径重做

AI资讯 Admin 6 次浏览

2026年8月24日,Meta Engineering 发布 MetaRoCE,称这是为大规模 AI 训练和推理重新设计的 RDMA 传输方案。它尝试在普通以太网上,用端点智能、路径遥测和丢包恢复能力维持 GPU 集群吞吐。Meta 计划在 10 月通过 Open Compute Project 发布协议规范、参考软件实现和合规测试套件,因此这次公告首先是架构和生态的起点。

Meta 为什么要重做传输层

传统 RoCE 依赖交换机侧优先级流控来减少丢包,但 AI 集群的流量会随训练阶段快速变化。暂停帧可能把拥塞扩散到更多设备,固定规则也难以适配多路径网络。某个梯度或激活张量迟到,就可能让整组 GPU 等待。

MetaRoCE 把更多判断放到发送端和接收端。端点收集每条路径的往返时延、ECN 标记和利用率,再动态分配数据;方案还支持乱序交付、原生多路径和不依赖 PFC 暂停帧的丢包容忍。目标不是假设网络永远无错,而是让通信在局部故障时继续前进。

三个设计如何共同减少等待

多路径可以利用多条链路,减少单一热点;乱序交付让已到达的数据不必等待最慢的包;发送端与接收端共同参与拥塞控制,能降低拥塞路径速率,再把流量转向有余量的路径。

Meta 表示,现有 RDMA Verbs 和大部分上层软件不需要大改;团队已在 AMD Pensando 网卡和 64 节点 AMD GPU 集群上验证。在公司公布的结果中,1% 丢包时仍达到约 86% 吞吐,10% 丢包时仍保留可用带宽。这些是 Meta 的受控实验结果,不能直接当成任何机房的保证值。

对 AI 基础设施意味着什么

如果规范、网卡固件、交换机和监控工具形成配套,AI 集群可能不必再用大量静态规则换取“看起来无丢包”。网络会更像能根据端点反馈自我调节的计算资源,训练作业也更容易跨拓扑扩展。

部署门槛仍然很高:团队要确认网卡和交换机支持、驱动是否兼容通信库,并重新建立故障注入与吞吐基线。在 OCP 规范和测试套件发布前,MetaRoCE 更适合被视为值得跟踪的基础设施方向,而不是今天就能替换现网 RoCE 的方案。

推荐工具

更多