Релиз модели1 октября 2026 г., 12:17 МСК🤖 Auto

NVIDIA Kumo Tabular: Open-модель для табличных данных с коммерческой лицензией

NVIDIA выпустила семейство Kumo Tabular — фундаментальные модели для классификации и регрессии, предсказывающие новые строки за один проход. В отличие от конкурентов, веса доступны под коммерческой лицензией OpenMDW-1.1.

Баннер новости 8681

Революция in-context learning для табличных данных

NVIDIA представила Kumo Tabular, новую архитектуру для работы со структурированными данными. В отличие от традиционных подходов, требующих дообучения (fine-tuning) и настройки гиперпараметров, Kumo Tabular использует механизм in-context learning. Модель принимает контекст из размеченных строк и предсказывает новые значения за один прямой проход (forward pass). Это устраняет необходимость в инженерии признаков и обучении с нуля.

Решение работает через библиотеку structured-data-models (SDM) — GPU-native фреймворк, который также поддерживает TabICLv2, TabFM и KumoRelational. Все модели используют единый интерфейс TableTensor для предобработки и ансамблирования.

Архитектура и обучение на синтетике

Модель построена на базе Transformer, оптимизированного под структуру таблиц. Процесс включает три этапа:

  • Cell embedding: Числовые и категориальные значения обрабатываются через обученные Фурье-признаки. Пропуски (missing values) не требуют импутации.
  • Row embedding: Используется induced self-attention для линейного роста стоимости по строкам и rotary positions для изучения взаимодействий признаков.
  • In-context learning: Финальный Transformer обрабатывает эмбеддинги строк. Ключи и значения контекста вычисляются один раз, что ускоряет инференс.

Важно отметить: Kumo Tabular обучена исключительно на синтетических таблицах, сгенерированных через Structural Causal Models (SCM). Генератор имитирует реальные проблемы: пропуски, высококардинальные категории, тяжелые хвосты распределений и конфликтующие дубликаты. Размеры моделей варьируются от 28M до 215M параметров.

Бенчмарки и сравнение с конкурентами

По данным NVIDIA, Kumo Tabular занимает первое место в рейтинге TabArena с Elo 1950. Модель работает в 17 раз быстрее LimiX-2 на одной RTX 6000 Pro. Ниже приведено сравнение ключевых характеристик с основными конкурентами:

ХарактеристикаKumo Tabular (NVIDIA)TabICLv2 (Inria)TabPFN-3 (Prior Labs)LimiX-2 (Stable AI)TabFM (Google)
Параметры28M – 215M~28MНе указано400M~1.64B
Лицензия весовOpenMDW-1.1 (Коммерческая)BSD-3-ClauseTABPFN-3 License v1.0 (Платная)Non-CommercialNon-Commercial
Коммерческое использованиеДаДаТребует лицензииНетНет
Рейтинг TabArena (Elo)1950 (1-е место)Информация недостаточнаИнформация недостаточнаИнформация недостаточнаИнформация недостаточна
Скорость (относительная)17x быстрее LimiX-2Информация недостаточнаИнформация недостаточнаБаза сравненияИнформация недостаточна

Практическое применение и запуск

Для использования требуется Python 3.11+ и PyTorch 2.7+. Установка осуществляется через pip:

pip install structured-data-models

Пример инициализации модели для классификации:

import sdm
from sklearn.datasets import load_breast_cancer

df = load_breast_cancer(as_frame=True).frame
table = sdm.TableTensor.from_pandas(df).stypes(sdm.infer_stypes(df))

model = sdm.models.KumoTabular(task="classification", device="cuda")
probs = model(x_context=table[:300].drop_columns("target"), 
              y_context=table[:300]["target"], 
              x_query=table[300:], 
              num_estimators=10)

Ключевое преимущество Kumo Tabular — сочетание лидерства в бенчмарках с открытой коммерческой лицензией, что делает её привлекательной для внедрения в промышленные решения, где другие open-source альтернативы (TabFM, LimiX-2) запрещены для коммерческого использования.

Источник: MarkTechPost ↗