NVIDIA、追加学習不要の表データAI「Kumo」公開
出典:Hugging Face
詳細を読む
NVIDIAは2026年9月29日、表形式データ向けのオープン基盤モデル「Kumo Tabular」をHugging Faceで公開しました。ラベル付きの行を文脈として読み込み、分類と回帰を利用時の追加学習・調整・特徴量設計なしに、1回の推論で実行します。顧客離脱や需要、価格などを予測する企業のモデル開発負荷を減らす狙いです。
NVIDIAの評価では、Kumo Tabularは4つのベンチマークで首位に立ちました。TabArenaではELO 1950を記録し、単一のRTX 6000 Proを使った共通条件で、精度と処理効率の新たな両立点を示したとしています。モデルは2800万〜2億1500万パラメーターの3種類です。
仕組みの核は、列内の値の位置づけ、行内の特徴同士の関係、ラベル付き行と予測対象行の関係を順に捉えるTransformerです。欠損値を補完せずに扱い、ラベル付き行の計算結果を再利用するほか、表が長くなっても注意を保つ仕組みで大規模な推論を効率化します。
事前学習には実データではなく、因果構造や欠損、外れ値などを組み込んだ人工表データだけを使いました。最大100列、最終段階で最大6万行の表を学習し、小・中・大の各モデルは約3500万、7100万、1億3700万個の人工表を経験しています。学習手順と人工データ生成器は今後公開する予定です。
モデルはOpenMDW-1.1ライセンスで商用利用でき、コード、重み、GPU向けライブラリも公開されています。ただし、直接扱えるのは数値列とカテゴリ列で、基本モデルの1回の推論は最大10クラスです。学習範囲を大きく超える表や分布の異なるデータでは精度が落ち得るため、導入時は自社の保留データで精度と確率の信頼性を検証する必要があります。