В мире корпоративного машинного обучения табличные данные остаются неоспоримым королем. От записей о клиентах и транзакций до логов датчиков и страховых случаев — вся бизнес-логика компаний хранится в строгих структурах строк и столбцов. На протяжении последних двух десятилетий индустрия полагалась на градиентный бустинг (gradient-boosted trees) для решения задач прогнозирования на таких данных. Этот подход работал отлично, но его жизненный цикл оставался неизменным и крайне трудоемким: каждый новый вопрос требовал сбора новых меток, ручной инженерии признаков, поиска гиперпараметров, валидации и развертывания модели, которая не знает ничего о таблицах в целом и учит каждую задачу с нуля.
Однако появление больших языковых моделей (LLM) показало совершенно иной путь взаимодействия с новыми задачами. Благодаря механизму обучения в контексте (in-context learning), предварительно обученная модель может решить новую задачу, просто увидев несколько примеров в промпте, не обновляя ни одного веса. Оказалось, что этот принцип применим к табличным данным так же эффективно, как и к тексту: модель, обученная на миллионах таблиц, может прочитать помеченную таблицу как контекст и напрямую предсказать метки для новых строк. Именно этот прорыв представляет собой NVIDIA Kumo Tabular — открытая фундаментальная модель для классификации и регрессии табличных данных, доступная на Hugging Face.
В этой статье мы подробно разберем, как работает Kumo Tabular, почему она устанавливает новые стандарты эффективности, как была создана и как вы можете запустить её локально или в облаке для решения реальных бизнес-задач. Мы также рассмотрим технические детали архитектуры, ограничения и практические шаги для внедрения.
01Сдвиг парадигмы: От ручного инжиниринга к фундаментальным моделям
Традиционный пайплайн работы с табличными данными (tabular data) часто становится узким местом в разработке AI-продуктов. Инженеры тратят до 80% времени на подготовку данных, а не на саму модель. Kumo Tabular предлагает радикально иной подход. Это модель-фундамент (foundation model), которая, получив на вход таблицу с помеченными строками, предсказывает метки для новых строк за один прямой проход (single forward pass). Никакого обучения, никакой тонкой настройки (fine-tuning), никакой инженерии признаков.
Это возможно благодаря тому, что Kumo Tabular была предварительно обучена исключительно на искусственных данных. Она доступна в трех размерах (от 28 до 215 миллионов параметров) и работает через открытую библиотеку NVIDIA. Лицензия OpenMDW-1.1 позволяет использовать модель в коммерческих целях, что делает её доступной для широкого круга разработчиков. На четырех ключевых бенчмарках — TabArena, BeyondArena, TALENT и ScoringBench — Kumo Tabular заняла первые места, демонстрируя беспрецедентное соотношение точности и скорости.

02Архитектура Kumo Tabular: Как это работает
В основе Kumo Tabular лежит архитектура Transformer, специально адаптированная под структуру табличных данных. Модель использует концепции внимания по колонкам, строкам и в контексте, введенные в предыдущих работах, таких как TabICL и TabPFN. Чтобы предсказать метку для новой строки, модель должна выполнить три ключевые задачи: понять значение каждого значения в рамках его колонки, понять взаимодействие между колонками внутри строки и связать контекстные строки с известными метками с запросами (query rows), у которых метки неизвестны.
Встраивание ячеек (Cell Embedding)
Группа ячеек преобразуется в токен. Числовые и категориальные значения проходят через механизм Fourier features, представляющий собой синусы и косинусы обучаемых частот, с отдельными весами для каждого типа данных. Это позволяет модели эффективно кодировать непрерывные и дискретные признаки. Особое внимание уделено пропущенным значениям: они не требуют импутации (заполнения) и обрабатываются специальным образом, что делает модель устойчивой к «грязным» данным.
Встраивание строк (Row Embedding)
Каждая строка преобразуется в эмбеддинг путем чередования двух типов внимания. Column attention (внимание по колонкам) смотрит вниз по одной колонке и учится понимать, что означает значение в распределении этой колонки. Например, оно определяет, является ли значение «42» типичным или экстремальным для данного столбца. Благодаря индуцированному само-вниманию, вычислительная сложность растет линейно с количеством строк. Row attention (внимание по строкам) смотрит на токены одной строки и учится понимать, как взаимодействуют признаки, используя поворотные позиции (rotary positions) для различения колонок. Четыре обучаемых токена [CLS] присоединяются к каждой строке и служат финальным считывающим узлом. После этого сжатия строки вычислительная сложность финального этапа больше не зависит от количества колонок.
Обучение в контексте (In-context Learning)
Финальный Transformer оперирует эмбеддингами строк. Строки контекста взаимодействуют друг с другом, в то время как строки запроса (query rows) обращаются только к строкам контекста. Каждое предсказание зависит только от контекста и самой строки запроса, а не от других строк, которые оцениваются одновременно. Поскольку контекст никогда не смотрит на запросы, его ключи (keys) и значения (values) вычисляются один раз и могут быть переиспользованы для последующих предсказаний. Строки запроса используют Test-GQA (Grouped-Query Attention), что значительно сокращает кэш, читаемый каждым предсказанием. Заголовочный слой (head) преобразует каждую строку запроса в вероятности классов для классификации и 999 квантилей для регрессии, из которых выводятся точечное предсказание и оценка неопределенности.
Температура внимания, зависящая от длины
Softmax-внимание имеет тенденцию «размазываться» по мере увеличения количества ключей. Внимание, которое остается острым (sharp) для нескольких сотен строк, может раствориться при работе с десятками тысяч строк — ситуация, когда таблица во время вывода (inference) значительно больше типичной обучающей таблицы. Kumo Tabular решает эту проблему, масштабируя каждый запрос с помощью температуры, которая растет логарифмически от количества ключей, с коэффициентом, обученным отдельно для каждой головы внимания. Результатом является внимание, которое остается острым, независимо от того, насколько длинными или широкими становятся таблицы.
03Генерация данных: Обучение на искусственных таблицах
Одним из самых инновационных аспектов Kumo Tabular является метод её обучения. Модель была предварительно обучена исключительно на искусственных таблицах, сгенерированных с помощью Структурной Каузальной Модели (Structural Causal Model, SCM). Этот подход позволяет создать бесконечный источник разнообразных данных, каждый раз с новым каузальным графом и новыми механизмами.

Процесс генерации каждой обучающей таблицы состоит из шести шагов. Сначала выбирается конфигурация всей таблицы: её размер, задача, механизмы и наличие пропущенных значений. Затем случайный каузальный граф связывает скрытые переменные, которые оцениваются от корня к листу с помощью случайно выбранных функций в каждом узле (например, линейные отображения, небольшие нейронные сети, деревья решений или гауссовские процессы). Некоторые узлы становятся числовыми или категориальными колонками, один узел становится целевой переменной, а остальные остаются скрытыми, подобно неизмеряемым причинам в реальных данных.

После этого применяется постобработка: группы колонок коррелируются, выбросы обрезаются, и внедряются пропущенные значения. Быстрая проверка на основе ансамбля деревьев отбрасывает любые таблицы, не имеющие обучаемого сигнала. Поскольку генератор является процедурным сэмплером, а не обученной моделью, он производит бесконечный поток таблиц.
Реальные таблицы часто бывают «грязными», поэтому разработчики намеренно внедрили множество несовершенств в генератор. Значения отсутствуют по разным паттернам, некоторые признаки упрощены, из-за чего дублирующиеся строки могут иметь разные метки, некоторые категориальные колонки содержат множество уровней, а целевые переменные регрессии могут иметь тяжелые хвосты распределения. Модель, увидевшая миллионы таких таблиц, учится справляться с этими несовершенствами без какой-либо предварительной очистки данных.
На каждой искусственной таблице модель видит большинство строк с их метками в качестве контекста и учится предсказывать метки оставшихся строк. Для классификации используется функция потерь cross-entropy, а для регрессии — quantile loss. Классификация и регрессия обучаются как отдельные модели. Обучение проходило в три этапа: первый (самый длинный) использовал таблицы из 1024 строк и до 100 колонок, чтобы научить модель понимать структуру таблиц. Второй этап варьировал контекст от 400 до 10 240 строк, а третий расширил его до 60 000 строк. В общей сложности модели Kumo Tabular Small/Medium/Large увидели около 35/71/137 миллионов искусственных таблиц соответственно.
04Производительность: Новые стандарты точности и скорости
Оценка Kumo Tabular проводилась в сравнении с полным лидербордом TabArena, который включает настроенные градиентные деревья, AutoGluon и новейшие табличные фундаментальные модели. Kumo Tabular заняла первое место в общем зачете с показателем ELO 1950. Примечательно, что она работает в 17 раз быстрее, чем LimiX-2, при использовании единой конфигурации с одной видеокартой RTX 6000 Pro.
Во всех трех размерах моделей Kumo Tabular устанавливает новое состояние искусства (state-of-the-art) на парето-фронте точности и эффективности. Это означает, что для любого заданного уровня скорости модель обеспечивает максимальную возможную точность, и наоборот.
Дополнительная оценка на других бенчмарках подтвердила лидерство модели:
- BeyondArena: Kumo Tabular достигла ELO 1418 с показателем улучшаемости (Improvability score) 7.78%, заняв первое место в лидерборде.
- TALENT: Модель заняла первое место в общем рейтинге по точности классификации, логарифмической потере классификации и RMSE регрессии, со средними рангами 6.67, 3.98 и 4.22 соответственно.
- ScoringBench: Это бенчмарк для предиктивных распределений. Kumo Tabular Large и Medium заняли первое и второе места по среднему рангу.
05Ограничения и практические аспекты
Несмотря на впечатляющие результаты, важно понимать ограничения модели. Kumo Tabular работает только с числовыми и категориальными колонками. Текстовые данные, изображения или временные метки (timestamps) необходимо предварительно преобразовать в признаки с помощью встроенных рецептов предобработки. Например, текст можно закодировать с помощью эмбеддингов, а время — разбить на компоненты (час, день недели и т.д.).
Один прямой проход покрывает до 10 классов. Библиотека расширяет эту возможность до любого количества классов с помощью кодов с коррекцией ошибок (error-correcting output codes). Точность может снизиться на таблицах, которые сильно выходят за пределы диапазонов, использованных при обучении, или когда строки запроса происходят из другого распределения, чем строки контекста. Как и с любой предиктивной моделью, перед развертыванием необходимо проверять точность и калибровку на собственных отложенных данных.

06Как запустить Kumo Tabular: Практическое руководство
Kumo Tabular работает через новую GPU-нативную библиотеку NVIDIA для моделей структурированных данных structured-data-models. Библиотека автоматически загружает веса из Hugging Face при первом использовании и предоставляет предобработку, ансамблирование и обработку многоклассовых задач, использованные в оценках.
Для запуска модели вам потребуется Python-окружение с поддержкой CUDA. Ниже приведен минимальный пример кода, который преобразует pandas.DataFrame в предсказание:
import sdm # structured-data-models
import pandas as pd
# Tensorize tabular data:
table = sdm.TableTensor.from_pandas(pd.load_csv(...), device="cuda")
na_mask = table["target"].isnan()
model = sdm.models.KumoTabular(device="cuda")
pred = model(
# In-context examples (features/targets):
x_context=table[~na_mask].drop_columns("target"),
y_context=table[~na_mask, "target"],
# Prediction examples (features):
x_query=table[na_mask].drop_column("target"),
)Этот код демонстрирует простоту интеграции. Вы загружаете данные, указываете, какие строки являются контекстом (с известными метками), а какие — запросами (без меток), и получаете предсказания. Библиотека берет на себя всю сложную работу по тензоризации и передаче данных на GPU.
07Лицензирование и безопасность
Kumo Tabular выпущена под лицензией OpenMDW License Agreement, version 1.1. NVIDIA считает, что доверенный ИИ (Trustworthy AI) — это общая ответственность, и установила политики и практики для разработки широкого спектра AI-приложений. При загрузке или использовании в соответствии с условиями обслуживания разработчики должны работать со своей поддерживающей моделью командой, чтобы убедиться, что эта модель соответствует требованиям соответствующей отрасли и случая использования, а также устраняет непредвиденное неправильное использование продукта. Рекомендуется сообщать о качестве модели, рисках, уязвимостях безопасности или проблемах NVIDIA AI здесь.
08Что это значит на практике
Появление NVIDIA Kumo Tabular знаменует собой конец эры «ручного» машинного обучения для табличных данных. Для компаний это означает:
- Сокращение времени выхода на рынок (Time-to-Market): Вместо недель или месяцев на разработку и обучение модели, вы можете получить работающий прототип за минуты, просто предоставив модель примерам данных.
- Снижение порога входа: Не требуется глубокая экспертиза в инженерии признаков или настройке гиперпараметров градиентного бустинга. Достаточно иметь чистые табличные данные.
- Масштабируемость: Благодаря оптимизации для GPU и эффективному механизму внимания, модель может обрабатывать большие объемы данных быстрее, чем традиционные методы, особенно при необходимости частых предсказаний.
- Универсальность: Одна модель для классификации и регрессии, работающая с различными типами данных (после простой предобработки), упрощает архитектуру ML-пайплайнов.
Для разработчиков в России и других странах, где доступ к облачным сервисам может быть ограничен, важно отметить, что модель можно запустить локально на GPU, поддерживающих CUDA. Библиотека structured-data-models и веса модели доступны через Hugging Face и GitHub, что позволяет полностью автономно развернуть решение внутри корпоративного контура. Это критически важно для секторов, где конфиденциальность данных является приоритетом (финансы, здравоохранение, госсектор).
Хотя Kumo Tabular не заменяет полностью градиентный бустинг в задачах, где требуется максимальная оптимизация под конкретный датасет с длительным циклом дообучения, она становится мощнейшим инструментом для быстрого прототипирования, обработки новых задач «на лету» и работы с данными, где сбор меток для обучения новой модели экономически нецелесообразен. Это шаг к будущему, где ИИ адаптируется к данным, а не данные подгоняются под ИИ.
Источник: Hugging Face ↗
