ToolNavs AI 도구 탐색
도구 제출 로그인
돌아가기 AI 정보
Meta Open, MetaRoCE: AI 클러스터 네트워크, 패킷 손실 및 다중경로 재작업 시작

Meta Open, MetaRoCE: AI 클러스터 네트워크, 패킷 손실 및 다중경로 재작업 시작

AI 정보 Admin 6 회 조회

2026년 8월 24일, Meta Engineering은 MetaRoCE를 공개하며, 대규모 AI 훈련 및 추론을 위해 재설계된 RDMA 전송 솔루션이라고 주장했습니다. 엔드포인트 인텔리전스, 경로 텔레메트리, 패킷 손실 복구 기능을 사용하여 일반 이더넷에서 GPU 클러스터 처리량을 유지하려고 시도합니다. Meta는 10월에 Open Compute Project를 통해 프로토콜 명세, 참조 소프트웨어 구현, 컴플라이언스 테스트 스위트를 공개할 계획이므로, 이번 발표는 아키텍처와 생태계의 출발점이 됩니다.

메타가 전송 계층을 다시 만드는 이유

전통적인 RoCE는 패킷 손실을 줄이기 위해 스위치 사이드 우선순위 흐름 제어에 의존하지만, AI 클러스터 트래픽은 훈련 단계에서 빠르게 변합니다. 일시정지 프레임은 혼잡을 더 많은 장치로 분산시킬 수 있으며, 고정된 규칙은 다중 경로 네트워크에 적응하기 어렵습니다. 그래디언트나 활성화 텐서가 늦으면 전체 GPU 그룹이 기다릴 수 있습니다.

MetaRoCE는 송수신 양쪽 모두에 더 많은 판단을 부여합니다. 엔드포인트는 각 경로에 대해 왕복 지연 시간, ECN 태깅, 활용률을 수집한 후 동적으로 데이터를 할당합니다; 이 솔루션은 또한 PFC 일시정지 프레임에 의존하지 않는 순서 불편 전송, 네이티브 멀티패스, 패킷 손실 허용도 지원합니다. 목표는 네트워크가 항상 완벽하다고 가정하는 것이 아니라, 지역 장애가 발생했을 때 통신을 계속 진행하는 것입니다.

세 가지 설계가 어떻게 함께 작용하여 대기 시간을 줄이나요

멀티패스는 단일 핫스팟을 줄이기 위해 여러 링크를 활용할 수 있습니다; 순서 불량 배송은 도착 데이터가 가장 느린 소포를 기다릴 필요가 없다는 의미입니다; 송신자와 수신자 모두 혼잡 제어에 참여하여 혼잡 경로 속도를 줄이고 추가 용량이 있는 경로로 트래픽을 재배치할 수 있습니다.

Meta는 기존 RDMA 동사와 대부분의 상위 계층 소프트웨어가 큰 변경이 필요하지 않다고 밝혔습니다; 팀은 AMD Pensando 네트워크 카드와 64노드 AMD GPU 클러스터에서 이를 검증했습니다. 회사의 발표 결과에 따르면, 1% 패킷 손실 시에도 약 86%의 처리량이 유지되었고, 10% 패킷 손실에서도 사용 가능한 대역폭이 유지되었습니다. 이것들은 메타의 통제된 실험 결과이며, 어떤 데이터 센터에도 대한 보장으로 받아들일 수 없습니다.

이것이 AI 인프라에 어떤 의미가 있을까요?

표준, 네트워크 카드 펌웨어, 스위치, 모니터링 도구가 조율된다면, AI 클러스터는 더 이상 많은 정적 규칙을 '겉보기에는 0%의 패킷 손실'을 위해 대량의 정적 규칙을 포기할 필요가 없을 수도 있습니다. 네트워크는 엔드포인트 피드백에 기반해 스스로 조절할 수 있는 컴퓨팅 자원과 비슷해져, 교육 작업을 토폴로지 전반에 걸쳐 확장하기 쉽게 만듭니다.

배포 임계값은 여전히 높으며, 팀이 네트워크 카드와 스위치 지원 및 드라이버가 통신 라이브러리와 호환되는지 확인하고, 결함 주입 및 처리량 기준선을 재설정해야 합니다. OCP 사양 및 테스트 스위트가 출시되기 전에는 MetaRoCE가 오늘날 현재의 RoCE를 대체할 수 있는 솔루션보다는 가치 있는 인프라 방향으로 인식되는 것이 더 적합하다.

추천 도구

더보기