ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
GLM-5.3-FlashX 출시: 최대 200 토큰/초, Zhipu가 대규모 모델 경쟁을 인프라로 밀어 넣다

GLM-5.3-FlashX 출시: 최대 200 토큰/초, Zhipu가 대규모 모델 경쟁을 인프라로 밀어 넣다

AI 정보 Admin 3 회 조회

Zhipu는 최대 추론 속도 200 토큰/초, API 동시 개방, 모델 키 GLM-5.3-FlashX를 공식 출시했습니다. 기존 GLM-5.3-Flash와 비교했을 때, 신제품은 약 5배 빠르고 가격은 2.5배 인상되었습니다. AI 모델 간 경쟁은 '누가 더 똑똑한가'에서 '누가 안정적으로 더 빠르고 저렴하게 출력할 수 있는가'로 전환되었습니다.

옥스 알파에서 플래시X까지

GLM-5.3-Flash는 이전에 익명으로 OpenCode와 OpenRouter에 Ox Alpha 로 로그인한 바 있습니다. Z.ai 출시 일주일 만에 이 모델이 두 주요 플랫폼에서 가장 자주 접근되는 모델 중 하나가 되었으며, 6일 동안 62조 개 이상의 토큰을 처리했으며, 높은 동시성 요구가 추론 인프라에 직접적인 부담을 가했습니다.

더 큰 모델을 재학습하는 것과 비교할 때, FlashX는 생산 환경의 "성능 계층화"에 가깝습니다: Flash 시리즈의 능력 위치를 유지하면서 출력 처리량을 200 토큰/초로 증가시켜 코딩 에이전트, 실시간 대화, 툴 호출을 가능하게 하여 대기 시간을 단축합니다.

10만 개의 국내 칩이 더 빠른 추론을 지원합니다

속도는 단순히 기계 수를 늘리는 것만이 아닙니다. Zhipu는 GLM-5.3-Flash 생산 추론이 10만 개 이상의 국내 AI 가속기 칩 클러스터에서 실행되며, 추론 시스템은 메모리, 대역폭, 새로운 모델 아키텍처에 맞게 재구축되었다고 밝혔습니다.

공식 최적화에는 W8A8 양자화, 혼합정밀도 캐시, 레이어 분할, 인코딩-프리필-디코드 분리 아키텍처가 포함됩니다. 여러 차례 최적화 후, 동일한 하드웨어에서의 엔드 투 엔드 서빙 성능은 초기 버전보다 약 3배 향상됩니다.

대형 모델 경쟁은 인프라 단계에 진입했습니다

FlashX는 속도를 더 높은 가격의 API 계층으로 만들어, 사실상 '낮은 지연'으로 가격을 책정합니다. 기업의 경우, 에이전트가 진행하는 모든 단계는 모델이 돌아올 때까지 기다려야 하며, 토큰/단위는 작업 체인을 수십 초에서 상호작용 가능한 범위로 압축할 수 있는지 직접 결정합니다.

모델 성능 격차가 좁아짐에 따라 추론 엔진, 칩 적응, 클러스터 스케줄링, 그리고 단위당 토큰 비용 등이 새로운 해자가 될 것입니다. GLM-5.3-FlashX의 중요성은 단순히 200 토큰/초 지표에 그치지 않고, 국내 컴퓨팅 파워가 대규모 실전 호출을 수행하고 인프라 최적화를 제품 차별화로 직접 전환하기 시작했다는 점에 있습니다.

추천 도구

더보기