Jalapeño 칩이 OpenAI 내부 배포 단계에 들어섰고, 그 옆에 놓이는 호스트 구성도 확인됐다. 2026년 10월 2일 Tom's Hardware는 SemiAnalysis의 랙 단위 배포 설명을 인용하고 OpenAI 하드웨어 부사장 Richard Ho와의 인터뷰를 곁들여, Jalapeño ASIC이 배포될 때 엔비디아 자체 플랫폼에서 쓰는 Vera가 아닌 AMD EPYC Turin 호스트 CPU와 함께 구성되며 호스트당 1.5TB 메모리를 갖춘다고 보도했다.
두 대의 랙이 나란히: 한쪽은 호스트, 다른 쪽은 칩 128개
SemiAnalysis가 설명한 배포 형태는 랙 두 대의 조합이다. Katsu라고 불리는 호스트 랙은 트레이 16개로 구성되며, 각 트레이에는 Turin급 EPYC 프로세서 2개, 1.5TB 일반 메모리, 로컬 NVMe 스토리지, 400G 프런트엔드 네트워크가 들어간다. Vindaloo라고 불리는 가속기 랙 역시 트레이 16개이며, 각 트레이에 Jalapeño 8개씩, 랙 전체에 칩 128개가 들어가 4비트 연산 최대 1.7 ExaFLOPs와 27.5TB HBM4 메모리를 제공한다. 두 랙은 PCIe 직접 연결 구리 케이블 8개로 대응하는 트레이끼리 일대일로 연결된다. Jalapeño 한 개의 소비전력은 약 700W이며, 12단 적층 HBM4 여섯 조로 15.4 TB/s의 메모리 대역폭을 낸다.
호스트 표가 AMD로 간 이유
AI 랙에서 호스트 CPU는 데이터 전처리, 작업 스케줄링, 가속기로의 요청 공급을 맡는다. 가장 눈에 띄는 부품은 아니지만 랙 전체의 조달 구조를 결정한다. 엔비디아의 방식은 GPU와 자체 Vera CPU를 묶어 파는 것으로, 깊이 살수록 종속이 강해진다. OpenAI는 가속기를 자체 제작 Jalapeño로 바꾼 데 이어 호스트까지 AMD를 골라, 이 체인에 엔비디아 부품이 하나도 없게 됐다. 이는 그동안 이어 온 다중 공급업체 전략과 맞닿아 있다. 학습은 엔비디아와 AMD의 GPU가 계속 맡고, 추론은 자체 칩과 여러 공급업체로 점차 분산해, 가장 빠르게 늘어나는 추론 비용을 단일 업체의 가격 결정에 맡기지 않겠다는 것이다.
속도는 그대로: 올해는 소량, 성적표도 여전히 자체 측정
찬물을 끼얹을 부분도 있다. Jalapeño는 2026년 6월 24일 OpenAI와 브로드컴이 공동 발표했고, 8월 25일 Hot Chips에서 공개된 첫 성적 — SemiAnalysis의 InferenceX 벤치마크에서 엔비디아 GB200, GB300 대비 킬로와트당 처리량 1.5~1.9배, 종단 간 지연 1.7~3.6배 개선 — 은 OpenAI 자체 측정 결과다. Ho가 제시한 일정은 2026년 말 아주 적은 물량으로 배포를 시작해 2027년에 본격 확대한다는 것이다. 이번에 호스트 구성이 확인된 것은 배포가 계획대로 진행 중임을 보여 주지만, GPU의 대규모 대체와는 아직 거리가 멀다. 관찰자에게 다음으로 중요한 것은 벤치마크 숫자가 아니라, 이 두 랙짜리 시스템이 실제 가동된 뒤 추론 1회당 실제 비용이 GPU 구성을 꾸준히 밑돌 수 있는가이다.