NVIDIA Kumo Tabular는 NVIDIA가 2026년 9월 29일 Hugging Face 공식 블로그를 통해 공개한 오픈 표 데이터 기반 모델로, 표 데이터의 분류·회귀 예측에 특화되어 있다. 내세우는 바는 명확하다. 레이블이 있는 표를 주면 한 번의 순전파로 새 행의 레이블을 예측한다. 학습도, 하이퍼파라미터 조정도, 피처 엔지니어링도 필요 없다.
노리는 것은 "질문마다 다시 학습"이라는 옛 공정의 종말
지난 20년, 기업의 표 예측은 그래디언트 부스팅 트리의 차지였다. 고객 이탈, 채무 불이행 위험, 수요 예측, 가격 책정 — 새로운 질문이 나올 때마다 레이블링, 피처 엔지니어링, 조정, 검증, 배포의 전 공정을 거쳐야 했다. 데이터가 바뀌면 학습도 처음부터 다시였다.
Kumo Tabular는 대규모 언어 모델의 in-context learning을 표로 가져오려 한다. 발상은 이렇다. 과거 데이터가 예제이고, 예측하고 싶은 열이 문제다. 모델은 레이블이 붙은 표 전체를 읽고, 그 자리에서 규칙성을 찾아 새 행의 답을 한 번에 계산한다. 한때 수주가 걸리던 반복 작업이 한 번의 추론으로 압축되는 것이다.
모델의 구성
Kumo Tabular는 NVIDIA의 Kumo Structured 모델 컬렉션에 속하며, 28M부터 215M 파라미터까지 세 가지 크기로 제공된다. 모두 합성 데이터로만 사전 학습되었고, 실제 업무 테이블을 본 적이 없다. 가중치는 Hugging Face Hub에 공개되어 있으며, 상업적 이용을 명시적으로 허용하는 OpenMDW-1.1 라이선스를 채택했다. 추론은 NVIDIA가 오픈소스로 공개한 structured-data-models 라이브러리를 통해 이루어지며, 첫 사용 시 가중치를 자동 다운로드하고 전처리, 앙상블, 다중 클래스 처리까지 내장하고 있다.
네 개의 공개 벤치마크 TabArena, BeyondArena, TALENT, ScoringBench에서 모두 1위를 차지했다. 그렇다고 모든 상황에서 튜닝된 XGBoost를 능가한다는 뜻은 아니다. 이 벤치마크들이 재는 것은 "조정 없이 바로 쓰는" 성능이다. 진짜 의의는 "학습 불필요"라는 노선에 처음으로 제대로 싸울 만한 성적표가 붙었다는 데 있다.
데이터팀에게 주는 의미
가장 직접적인 수혜자는 빠른 검증을 하는 데이터팀이다. 다음에 "이 고객층이 이탈할지 예측해 달라"는 요청이 오면, 먼저 Kumo Tabular를 베이스라인으로 돌려 신호의 강도를 보고, 본격적인 학습 파이프라인에 투자할 가치가 있는지 판단할 수 있다. 데이터 규모가 중간 정도이고, 피처 엔지니어링 비용이 높으며, 질문이 빨리 바뀌는 장면에 가장 잘 맞는다. 사기 탐지, 신용 리스크, 수요 예측이 주 전장이 될 것이다.
물론 한계도 있다. 초대규모 표, 깊은 도메인 지식의 피처 엔지니어링이 필요한 문제, 설명 가능성에 엄격한 요건이 있는 금융 컴플라이언스 장면은 당분간 기존 공정에 남을 것이다. "일단 한 번 돌려보는" 가속기로 보는 것이 정확하고, "이제 학습은 필요 없다"는 종착점은 아니다.
배경: Kumo 인수 후 첫 공개 답변
Kumo Tabular에는 업계적 의미도 있다. NVIDIA가 2026년 6월 예측 AI 기업 Kumo AI를 4억 달러가 넘는 금액에 인수한 이후 첫 공개 결과물이기 때문이다. 창업팀은 화려하다. Airbnb와 Pinterest의 전 CTO, 스탠퍼드 교수, PyTorch Geometric의 저자들. 이들이 앞서 내놓은 관계형 데이터용 기반 모델 KumoRFM은 이미 DoorDash, Snowflake 등에서 실제 운영 중이다.
이번 공개는 Kumo의 능력을 관계형 데이터에서 훨씬 일반적인 단일 테이블로 내려오면서, 오픈소스를 선택했다는 뜻이다. 9월 초 Hugging Face 인수와 함께 읽으면, NVIDIA가 "오픈 모델 생태계"를 AI 제국의 무거운 조각으로 만들고 있음이 보인다. Kumo Tabular는 그 퍼즐 안에서 처음으로 기업 데이터팀을 정면으로 겨냥한 한 수다.