Главная/Блог/Гайд/NVIDIA Kumo Tabular: Революция в работе…
Гайд11 мин чтения · 29 сентября 2026 г.

NVIDIA Kumo Tabular: Революция в работе с табличными данными

NVIDIA представила Kumo Tabular — первую открытую фундаментальную модель для табличных данных, достигающую нового уровня точности и скорости без дообучения.

NVIDIA Kumo Tabular: Революция в работе с табличными данными

В мире корпоративного машинного обучения табличные данные остаются неоспоримым королем. От записей о клиентах и транзакций до логов датчиков и страховых случаев — вся бизнес-логика компаний хранится в строгих структурах строк и столбцов. На протяжении последних двух десятилетий индустрия полагалась на градиентный бустинг (gradient-boosted trees) для решения задач прогнозирования на таких данных. Этот подход работал отлично, но его жизненный цикл оставался неизменным и крайне трудоемким: каждый новый вопрос требовал сбора новых меток, ручной инженерии признаков, поиска гиперпараметров, валидации и развертывания модели, которая не знает ничего о таблицах в целом и учит каждую задачу с нуля.

Однако появление больших языковых моделей (LLM) показало совершенно иной путь взаимодействия с новыми задачами. Благодаря механизму обучения в контексте (in-context learning), предварительно обученная модель может решить новую задачу, просто увидев несколько примеров в промпте, не обновляя ни одного веса. Оказалось, что этот принцип применим к табличным данным так же эффективно, как и к тексту: модель, обученная на миллионах таблиц, может прочитать помеченную таблицу как контекст и напрямую предсказать метки для новых строк. Именно этот прорыв представляет собой NVIDIA Kumo Tabular — открытая фундаментальная модель для классификации и регрессии табличных данных, доступная на Hugging Face.

В этой статье мы подробно разберем, как работает Kumo Tabular, почему она устанавливает новые стандарты эффективности, как была создана и как вы можете запустить её локально или в облаке для решения реальных бизнес-задач. Мы также рассмотрим технические детали архитектуры, ограничения и практические шаги для внедрения.

01Сдвиг парадигмы: От ручного инжиниринга к фундаментальным моделям

Традиционный пайплайн работы с табличными данными (tabular data) часто становится узким местом в разработке AI-продуктов. Инженеры тратят до 80% времени на подготовку данных, а не на саму модель. Kumo Tabular предлагает радикально иной подход. Это модель-фундамент (foundation model), которая, получив на вход таблицу с помеченными строками, предсказывает метки для новых строк за один прямой проход (single forward pass). Никакого обучения, никакой тонкой настройки (fine-tuning), никакой инженерии признаков.

Это возможно благодаря тому, что Kumo Tabular была предварительно обучена исключительно на искусственных данных. Она доступна в трех размерах (от 28 до 215 миллионов параметров) и работает через открытую библиотеку NVIDIA. Лицензия OpenMDW-1.1 позволяет использовать модель в коммерческих целях, что делает её доступной для широкого круга разработчиков. На четырех ключевых бенчмарках — TabArena, BeyondArena, TALENT и ScoringBench — Kumo Tabular заняла первые места, демонстрируя беспрецедентное соотношение точности и скорости.

Архитектура модели Kumo Tabular: визуализация взаимодействия слоев и типов внимания.
Архитектура модели Kumo Tabular: визуализация взаимодействия слоев и типов внимания.

02Архитектура Kumo Tabular: Как это работает

В основе Kumo Tabular лежит архитектура Transformer, специально адаптированная под структуру табличных данных. Модель использует концепции внимания по колонкам, строкам и в контексте, введенные в предыдущих работах, таких как TabICL и TabPFN. Чтобы предсказать метку для новой строки, модель должна выполнить три ключевые задачи: понять значение каждого значения в рамках его колонки, понять взаимодействие между колонками внутри строки и связать контекстные строки с известными метками с запросами (query rows), у которых метки неизвестны.

Встраивание ячеек (Cell Embedding)

Группа ячеек преобразуется в токен. Числовые и категориальные значения проходят через механизм Fourier features, представляющий собой синусы и косинусы обучаемых частот, с отдельными весами для каждого типа данных. Это позволяет модели эффективно кодировать непрерывные и дискретные признаки. Особое внимание уделено пропущенным значениям: они не требуют импутации (заполнения) и обрабатываются специальным образом, что делает модель устойчивой к «грязным» данным.

Встраивание строк (Row Embedding)

Каждая строка преобразуется в эмбеддинг путем чередования двух типов внимания. Column attention (внимание по колонкам) смотрит вниз по одной колонке и учится понимать, что означает значение в распределении этой колонки. Например, оно определяет, является ли значение «42» типичным или экстремальным для данного столбца. Благодаря индуцированному само-вниманию, вычислительная сложность растет линейно с количеством строк. Row attention (внимание по строкам) смотрит на токены одной строки и учится понимать, как взаимодействуют признаки, используя поворотные позиции (rotary positions) для различения колонок. Четыре обучаемых токена [CLS] присоединяются к каждой строке и служат финальным считывающим узлом. После этого сжатия строки вычислительная сложность финального этапа больше не зависит от количества колонок.

Обучение в контексте (In-context Learning)

Финальный Transformer оперирует эмбеддингами строк. Строки контекста взаимодействуют друг с другом, в то время как строки запроса (query rows) обращаются только к строкам контекста. Каждое предсказание зависит только от контекста и самой строки запроса, а не от других строк, которые оцениваются одновременно. Поскольку контекст никогда не смотрит на запросы, его ключи (keys) и значения (values) вычисляются один раз и могут быть переиспользованы для последующих предсказаний. Строки запроса используют Test-GQA (Grouped-Query Attention), что значительно сокращает кэш, читаемый каждым предсказанием. Заголовочный слой (head) преобразует каждую строку запроса в вероятности классов для классификации и 999 квантилей для регрессии, из которых выводятся точечное предсказание и оценка неопределенности.

Температура внимания, зависящая от длины

Softmax-внимание имеет тенденцию «размазываться» по мере увеличения количества ключей. Внимание, которое остается острым (sharp) для нескольких сотен строк, может раствориться при работе с десятками тысяч строк — ситуация, когда таблица во время вывода (inference) значительно больше типичной обучающей таблицы. Kumo Tabular решает эту проблему, масштабируя каждый запрос с помощью температуры, которая растет логарифмически от количества ключей, с коэффициентом, обученным отдельно для каждой головы внимания. Результатом является внимание, которое остается острым, независимо от того, насколько длинными или широкими становятся таблицы.

03Генерация данных: Обучение на искусственных таблицах

Одним из самых инновационных аспектов Kumo Tabular является метод её обучения. Модель была предварительно обучена исключительно на искусственных таблицах, сгенерированных с помощью Структурной Каузальной Модели (Structural Causal Model, SCM). Этот подход позволяет создать бесконечный источник разнообразных данных, каждый раз с новым каузальным графом и новыми механизмами.

NVIDIA Kumo Tabular: Революция в работе с табличными данными

Процесс генерации каждой обучающей таблицы состоит из шести шагов. Сначала выбирается конфигурация всей таблицы: её размер, задача, механизмы и наличие пропущенных значений. Затем случайный каузальный граф связывает скрытые переменные, которые оцениваются от корня к листу с помощью случайно выбранных функций в каждом узле (например, линейные отображения, небольшие нейронные сети, деревья решений или гауссовские процессы). Некоторые узлы становятся числовыми или категориальными колонками, один узел становится целевой переменной, а остальные остаются скрытыми, подобно неизмеряемым причинам в реальных данных.

Процесс генерации искусственных данных с использованием Структурной Каузальной Модели (SCM).
Процесс генерации искусственных данных с использованием Структурной Каузальной Модели (SCM).

После этого применяется постобработка: группы колонок коррелируются, выбросы обрезаются, и внедряются пропущенные значения. Быстрая проверка на основе ансамбля деревьев отбрасывает любые таблицы, не имеющие обучаемого сигнала. Поскольку генератор является процедурным сэмплером, а не обученной моделью, он производит бесконечный поток таблиц.

Реальные таблицы часто бывают «грязными», поэтому разработчики намеренно внедрили множество несовершенств в генератор. Значения отсутствуют по разным паттернам, некоторые признаки упрощены, из-за чего дублирующиеся строки могут иметь разные метки, некоторые категориальные колонки содержат множество уровней, а целевые переменные регрессии могут иметь тяжелые хвосты распределения. Модель, увидевшая миллионы таких таблиц, учится справляться с этими несовершенствами без какой-либо предварительной очистки данных.

На каждой искусственной таблице модель видит большинство строк с их метками в качестве контекста и учится предсказывать метки оставшихся строк. Для классификации используется функция потерь cross-entropy, а для регрессии — quantile loss. Классификация и регрессия обучаются как отдельные модели. Обучение проходило в три этапа: первый (самый длинный) использовал таблицы из 1024 строк и до 100 колонок, чтобы научить модель понимать структуру таблиц. Второй этап варьировал контекст от 400 до 10 240 строк, а третий расширил его до 60 000 строк. В общей сложности модели Kumo Tabular Small/Medium/Large увидели около 35/71/137 миллионов искусственных таблиц соответственно.

04Производительность: Новые стандарты точности и скорости

Оценка Kumo Tabular проводилась в сравнении с полным лидербордом TabArena, который включает настроенные градиентные деревья, AutoGluon и новейшие табличные фундаментальные модели. Kumo Tabular заняла первое место в общем зачете с показателем ELO 1950. Примечательно, что она работает в 17 раз быстрее, чем LimiX-2, при использовании единой конфигурации с одной видеокартой RTX 6000 Pro.

Во всех трех размерах моделей Kumo Tabular устанавливает новое состояние искусства (state-of-the-art) на парето-фронте точности и эффективности. Это означает, что для любого заданного уровня скорости модель обеспечивает максимальную возможную точность, и наоборот.

Дополнительная оценка на других бенчмарках подтвердила лидерство модели:

  • BeyondArena: Kumo Tabular достигла ELO 1418 с показателем улучшаемости (Improvability score) 7.78%, заняв первое место в лидерборде.
  • TALENT: Модель заняла первое место в общем рейтинге по точности классификации, логарифмической потере классификации и RMSE регрессии, со средними рангами 6.67, 3.98 и 4.22 соответственно.
  • ScoringBench: Это бенчмарк для предиктивных распределений. Kumo Tabular Large и Medium заняли первое и второе места по среднему рангу.

05Ограничения и практические аспекты

Несмотря на впечатляющие результаты, важно понимать ограничения модели. Kumo Tabular работает только с числовыми и категориальными колонками. Текстовые данные, изображения или временные метки (timestamps) необходимо предварительно преобразовать в признаки с помощью встроенных рецептов предобработки. Например, текст можно закодировать с помощью эмбеддингов, а время — разбить на компоненты (час, день недели и т.д.).

Один прямой проход покрывает до 10 классов. Библиотека расширяет эту возможность до любого количества классов с помощью кодов с коррекцией ошибок (error-correcting output codes). Точность может снизиться на таблицах, которые сильно выходят за пределы диапазонов, использованных при обучении, или когда строки запроса происходят из другого распределения, чем строки контекста. Как и с любой предиктивной моделью, перед развертыванием необходимо проверять точность и калибровку на собственных отложенных данных.

NVIDIA Kumo Tabular: Революция в работе с табличными данными
💡
Совет для разработчиков. При работе с многоклассовой классификацией (более 10 классов) обязательно используйте встроенный механизм error-correcting output codes из библиотеки sdm, чтобы избежать падения точности.

06Как запустить Kumo Tabular: Практическое руководство

Kumo Tabular работает через новую GPU-нативную библиотеку NVIDIA для моделей структурированных данных structured-data-models. Библиотека автоматически загружает веса из Hugging Face при первом использовании и предоставляет предобработку, ансамблирование и обработку многоклассовых задач, использованные в оценках.

Для запуска модели вам потребуется Python-окружение с поддержкой CUDA. Ниже приведен минимальный пример кода, который преобразует pandas.DataFrame в предсказание:

terminalpython
import sdm  # structured-data-models
import pandas as pd

# Tensorize tabular data:
table = sdm.TableTensor.from_pandas(pd.load_csv(...), device="cuda")
na_mask = table["target"].isnan()

model = sdm.models.KumoTabular(device="cuda")

pred = model(
    # In-context examples (features/targets):
    x_context=table[~na_mask].drop_columns("target"),
    y_context=table[~na_mask, "target"],
    # Prediction examples (features):
    x_query=table[na_mask].drop_column("target"),
)

Этот код демонстрирует простоту интеграции. Вы загружаете данные, указываете, какие строки являются контекстом (с известными метками), а какие — запросами (без меток), и получаете предсказания. Библиотека берет на себя всю сложную работу по тензоризации и передаче данных на GPU.

07Лицензирование и безопасность

Kumo Tabular выпущена под лицензией OpenMDW License Agreement, version 1.1. NVIDIA считает, что доверенный ИИ (Trustworthy AI) — это общая ответственность, и установила политики и практики для разработки широкого спектра AI-приложений. При загрузке или использовании в соответствии с условиями обслуживания разработчики должны работать со своей поддерживающей моделью командой, чтобы убедиться, что эта модель соответствует требованиям соответствующей отрасли и случая использования, а также устраняет непредвиденное неправильное использование продукта. Рекомендуется сообщать о качестве модели, рисках, уязвимостях безопасности или проблемах NVIDIA AI здесь.

⚠️ Важно.
Перед использованием в коммерческих проектах обязательно ознакомьтесь с лицензией OpenMDW-1.1. Она разрешает коммерческое использование, но накладывает определенные обязательства по безопасности и этике.

08Что это значит на практике

Появление NVIDIA Kumo Tabular знаменует собой конец эры «ручного» машинного обучения для табличных данных. Для компаний это означает:

  1. Сокращение времени выхода на рынок (Time-to-Market): Вместо недель или месяцев на разработку и обучение модели, вы можете получить работающий прототип за минуты, просто предоставив модель примерам данных.
  2. Снижение порога входа: Не требуется глубокая экспертиза в инженерии признаков или настройке гиперпараметров градиентного бустинга. Достаточно иметь чистые табличные данные.
  3. Масштабируемость: Благодаря оптимизации для GPU и эффективному механизму внимания, модель может обрабатывать большие объемы данных быстрее, чем традиционные методы, особенно при необходимости частых предсказаний.
  4. Универсальность: Одна модель для классификации и регрессии, работающая с различными типами данных (после простой предобработки), упрощает архитектуру ML-пайплайнов.

Для разработчиков в России и других странах, где доступ к облачным сервисам может быть ограничен, важно отметить, что модель можно запустить локально на GPU, поддерживающих CUDA. Библиотека structured-data-models и веса модели доступны через Hugging Face и GitHub, что позволяет полностью автономно развернуть решение внутри корпоративного контура. Это критически важно для секторов, где конфиденциальность данных является приоритетом (финансы, здравоохранение, госсектор).

Хотя Kumo Tabular не заменяет полностью градиентный бустинг в задачах, где требуется максимальная оптимизация под конкретный датасет с длительным циклом дообучения, она становится мощнейшим инструментом для быстрого прототипирования, обработки новых задач «на лету» и работы с данными, где сбор меток для обучения новой модели экономически нецелесообразен. Это шаг к будущему, где ИИ адаптируется к данным, а не данные подгоняются под ИИ.

📌 Факт.
Код модели доступен на GitHub: https://github.com/NVIDIA/structured-data-models. Веса: https://huggingface.co/nvidia/Kumo-Tabular.

Источник: Hugging Face ↗