ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
Baseten 실측: Claude가 작성한 추론 엔진, vLLM보다 90% 빠르다

Baseten 실측: Claude가 작성한 추론 엔진, vLLM보다 90% 빠르다

AI 정보 • Admin • • 20 회 조회

추론 엔진을 AI 에이전트가 처음부터 작성해 성숙한 범용 프레임워크를 앞지를 수 있을까? 2026년 10월 2일 업데이트된 Baseten 엔지니어링 블로그가 실측 결과를 공개했다. 엔지니어들은 MetaInfer 논문을 참고해 Claude Code(Fable 5)로 Qwen-3.6-35B-A3B용 맞춤 추론 엔진을 처음부터 구축했고, NVFP4 정밀도, 단일 NVIDIA B200에서 실행해 VibeQwen이라 이름 붙였다. MetaInfer는 skills-only 프레임워크를 사용하며 모델 후훈련이 필요 없다.

핵심 수치: 단일 스트림 90% 고속, 첫 토큰 지연 절반 이하로

VibeQwen의 단일 스트림 디코딩은 1792 TPS에 도달해 튜닝된 vLLM 0.25.1의 943 TPS보다 90% 빨랐다. 첫 토큰 지연은 12ms 대 28ms로 2.33배 개선됐고, 동시성 32에서는 출력 처리량 10307 TPS를 기록해 vLLM의 6030 TPS보다 71% 높았다. 비교 기준이 기본 설정이 아닌 튜닝된 vLLM이라는 점이 중요하다.

목표는 전 지표에서 vLLM을 20% 앞서면서 정확도를 잃지 않는 것이었고, 정확도 기준은 BF16이었다. Claude는 약 일주일간 기본적으로 자율적으로 작업하며 약 17억 토큰(대부분 캐시 입력)과 약 200 B200 시간을 소비했고, 처음 며칠 만에 vLLM을 따라잡았다. 정확도에 미세한 수치 차이가 생기면 사람의 승인이 필요했다.

두 번째 실험 Sammie: 지식 베이스 재사용으로 더 빠르고 저렴하게

Baseten은 이어 두 번째 실험 Sammie를 진행했다. 이미지 분할 모델 SAM 3.1용 추론 서비스를 구축해 단일 H100에서 초당 91장을 달성, Meta 공식 레퍼런스 서버보다 처리량이 50% 높았고, 기간은 며칠, 토큰은 약 2억 개에 불과했다. 더 빠르고 저렴했던 이유는 첫 번째 실험에서 쌓인 지식 베이스를 재사용했기 때문이다. 두 실험의 비용은 Sammie의 수백 달러에서 VibeQwen의 수천 달러까지 분포한다. 경험을 재사용할 수 있다는 이 특성은 단 한 번의 성적보다 더 주목할 만하다.

한계와 전제: 아직 실험 단계, 정확도 제약부터 고정해야

두 엔진 모두 아직 실험 단계로, 실제 운영 트래픽을 처리하지 않는다. Baseten에 따르면 실험에서는 에이전트가 vLLM과 TensorRT-LLM의 기존 커널을 참조할 수 있도록 허용했으며, 원 논문처럼 소스 코드와 완전히 격리하지는 않았다. 이런 자동 최적화가 성립하려면 두 가지 전제가 필요하다. 추론 지표가 정량화 가능하고 정확성을 고정밀 레퍼런스 구현과 수치로 검증할 수 있어야 개선의 객관적 잣대가 생긴다. 그리고 정확도 제약을 미리 고정해야 한다. 그렇지 않으면 에이전트는 같은 문자만 출력해 지표를 부풀리는 식으로 빈틈을 파고든다.

범용 엔진의 약점이 곧 맞춤 최적화의 자리

vLLM, SGLang, TensorRT-LLM은 범용성과 사용 편의성에서 앞서지만, 특정한 '모델+하드웨어+부하' 조합에서는 보통 최적 해법이 아니다. 추론 지출 규모가 워낙 커서 한 자릿수 퍼센트 개선만으로도 대규모 배포에서는 수백만 달러에 해당한다. 전용 엔진이 필요한 자리가 바로 여기다.

추천 도구

더보기