NVIDIA Kumo Tabular は、NVIDIA が 2026 年 9 月 29 日に Hugging Face 公式ブログで公開した、表形式データの分類・回帰予測に特化したオープンな表データ基盤モデルです。売り文句は明快で、ラベル付きの表を渡せば、1 回の順伝播で新しい行のラベルを予測します。学習も、ハイパーパラメータ調整も、特徴量エンジニアリングも不要です。
狙うのは「質問ごとに学習し直す」旧来フローの終焉
この 20 年、企業の表予測は勾配ブースティング木の天下でした。顧客離反、債務不履行リスク、需要予測、価格設定——新しい問いが出るたびに、ラベリング、特徴量エンジニアリング、調整、検証、デプロイの一連の工程が必要でした。データが変われば、学習のやり直しです。
Kumo Tabular は大規模言語モデルの in-context learning を表に持ち込もうとしています。発想はこうです。過去のデータが例題、予測したい列が問題——モデルはラベル付きの表全体を読み込み、その場で規則性を見つけて、新しい行の答えを一気に算出します。かつて数週間かかっていた反復作業が、1 回の推論に圧縮されるのです。
モデルの中身
Kumo Tabular は NVIDIA の Kumo Structured モデルコレクションに属し、28M から 215M パラメータの 3 サイズ展開。すべて合成データのみで事前学習されており、実際の業務テーブルを見たことはありません。重みは Hugging Face Hub で公開され、商用利用を明示的に認める OpenMDW-1.1 ライセンスを採用。推論は NVIDIA がオープンソース化した structured-data-models ライブラリ経由で、初回利用時に重みを自動ダウンロードし、前処理、アンサンブル、多クラス処理まで内包しています。
4 つの公開ベンチマーク、TabArena、BeyondArena、TALENT、ScoringBench でいずれも 1 位を獲得しました。だからといって、あらゆる場面で調整済みの XGBoost を上回るわけではありません。これらのベンチマークが測っているのは「調整なし・そのまま使える」性能です。本当の意義は、「学習不要」という路線に、初めてまともに戦える成績表が付いたことにあります。
データチームにとっての意味
最も直接的な受益者は、高速な検証を行うデータチームです。次に「この顧客層は離反しそうか予測してほしい」と頼まれたら、まず Kumo Tabular をベースラインとして走らせ、シグナルの強さを見てから、本格的な学習パイプラインに投資する価値があるか判断できます。データ規模が中程度で、特徴量エンジニアリングのコストが高く、問いが速く変わる場面に最適です。不正検知、信用リスク、需要予測が主戦場になります。
もちろん限界もあります。超大規模な表、深いドメイン知識の特徴量エンジニアリングが必要な問題、説明可能性に厳しい要件がある金融コンプライアンスの場面は、当面は従来フローに残るでしょう。「まず 1 回走らせる」加速器として捉えるのが正確で、「もう学習はいらない」の終着点ではありません。
背景:Kumo 買収後、初の公開回答
Kumo Tabular には業界的な意味もあります。NVIDIA が 2026 年 6 月に予測 AI 企業の Kumo AI を 4 億ドル超で買収して以来、初の公開成果物だからです。創業チームは錚々たる顔ぶれで、Airbnb と Pinterest の元 CTO、スタンフォード大学教授、PyTorch Geometric の作者たち。彼らが先に投入した関係データ向け基盤モデル KumoRFM は、すでに DoorDash や Snowflake などで本番運用されています。
今回の公開は、Kumo の能力を関係データから、より一般的な単一テーブルへ下ろし、しかもオープンソースを選んだことになります。9 月初旬の Hugging Face 買収と合わせて読めば、NVIDIA が「オープンモデルエコシステム」を AI 帝国の重いピースにしつつあることが見えてきます。Kumo Tabular は、そのパズルの中で初めて企業データチームを真正面から狙った一手です。