ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Prime Inference 출시: 프런티어 오픈 모델을 위한 추론 서비스, 경쟁력은 안정성

Prime Inference 출시: 프런티어 오픈 모델을 위한 추론 서비스, 경쟁력은 안정성

AI 정보 • Admin • • 9 회 조회

Prime Inference는 2026년 10월 2일 Prime Intellect가 공식 발표한, 프런티어 오픈 모델을 위한 추론 서비스입니다. 여러 데이터 센터에서 자체 GPU 인프라를 이용해 서버리스 엔드포인트와 예약 용량 두 가지 형태를 제공하며, 프로덕션급 SLA, 보안 및 개인정보 설계, 통합 청구와 팀 단위 사용량 추적을 갖추고, 데이터 센터 간 자동 장애 전환을 지원하며, 호출 방식은 OpenAI 인터페이스 형식과 호환됩니다.

먼저 집에서 검증하고, 그다음 밖으로 판다

Prime Inference는 원래 Prime Intellect의 자체 플랫폼으로, 대규모 강화학습 롤아웃, 합성 데이터 생성, 평가와 장시간 실행되는 프로그래밍 에이전트를 지원하며 내부에서 하루 약 1조 token을 처리했고, 2026년 1월부터는 고객을 위한 대규모 프로덕션 배포도 맡아 왔습니다. 첫 공개 배포는 GLM-5.3으로, 9월 22일 OpenRouter에 출시되어 그곳에서 가장 빠른 GLM-5.3 엔드포인트 중 하나가 됐고, 도구 호출 오류율은 0에 가깝고, 출시 이후 100% 가용성을 유지하고 있습니다.

기반은 Blackwell, 소프트웨어 스택은 익숙한 얼굴들

현재는 NVIDIA Blackwell 위에서 실행되며, 차세대 Vera Rubin이 곧 뒤를 잇습니다. 소프트웨어 측면에서는 NVIDIA Dynamo, vLLM, Mooncake, FlashInfer를 조합하고, Inferact 및 NVIDIA와 긴밀히 협력하며 개선 사항을 업스트림 오픈소스 프로젝트에 환원합니다. 이런 기반의 위치에 대해서는 vLLM은 어떤 팀에 적합한가? 고성능 추론 기반이지, 설치하자마자 바로 쓸 수 있는 채팅 제품은 아니다를 참고할 수 있습니다.

엔지니어링 수치가 실력을 말해 줍니다. 프리필과 디코딩을 서로 다른 GPU 그룹으로 분리한 결과 p90 토큰 간 지연이 약 40% 줄었습니다. 단계별 프리필 토큰 예산을 8K에서 4K로 절반으로 줄이자 대기열 대기 시간 중앙값이 550밀리초에서 110밀리초로 줄었고, 첫 토큰 시간 중앙값도 약 20% 감소했습니다. 또 NVFP4로 KV 캐시를 압축해 행당 576바이트에서 352바이트로 줄인 결과, 같은 메모리에서 캐시 용량이 약 50% 늘어나 디코더당 약 109만 token에서 163만 token으로 증가했습니다. 사용자당 초당 100 token을 목표로 할 때, 프리필 대 디코딩 비율 1:4에서 프리필 그룹 하나당 66개의 동시 세션을 처리할 수 있습니다.

에이전트 워크로드의 경쟁은 이제 연산 능력만이 아니다

에이전트 워크로드의 특징은 긴 컨텍스트와 이력을 반복 재사용하는 멀티턴 대화이며, 추론 서비스의 병목은 연산 능력 자체보다 캐시와 스케줄링에 점점 더 많이 놓이고 있습니다. 모델 가중치가 오픈돼 있다고 해서 바로 프로덕션에 투입할 수 있는 것은 아니며, 기업에는 여전히 사용량 추적, 장애 전환, 책임 주체가 분명한 가용성 약속이 필요합니다. Prime Inference는 이 모든 것을 SLA가 있는 관리형 레이어로 만들었으며, 이는 오픈 모델이 프로덕션으로 가는 길에 정확히 부족했던 부분입니다.

추천 도구

더보기