Революция в табличных данных: Zero-shot подход
Компания NVIDIA выпустила Kumo Tabular, первую открытую фундаментальную модель (Foundation Model) для структурированных данных. В отличие от традиционных градиентных бустингов (XGBoost, LightGBM), требующих сбора меток, инженерии признаков и тонкой настройки для каждой новой задачи, Kumo Tabular работает по принципу in-context learning. Модель предсказывает метки новых строк за один проход (forward pass) без обновления весов, дообучения или ручной обработки пропущенных значений.
Модель доступна на Hugging Face под лицензией OpenMDW-1.1 (разрешает коммерческое использование) и представлена в трех размерах: от 28 млн до 215 млн параметров. Исходный код библиотеки также опубликован в открытом доступе.
Архитектура: Как модель «понимает» таблицы
Kumo Tabular — это Transformer, специализированный для структуры таблиц. Он решает три ключевые задачи: интерпретация значений в колонках, анализ взаимодействия признаков в строке и сопоставление контекстных строк с целевыми. Архитектура включает:
- Cell Embedding: Числовые и категориальные значения преобразуются через фурье-компоненты. Пропуски обрабатываются явно, без импутации.
- Row Embedding: Используется чередование «column attention» (анализ распределения в колонке) и «row attention» (взаимодействие признаков). Вводятся 4 learnable [CLS] токена для сжатия строки.
- Length-aware Attention Temperature: Уникальный механизм масштабирования температуры softmax, который сохраняет четкость внимания при работе с таблицами, значительно превышающими размер обучающей выборки (до 60 000 строк).
Обучение на синтетических данных
Удивительно, но модель обучалась исключительно на искусственных данных, сгенерированных через Structural Causal Models (SCM). Генератор создавал бесконечный поток таблиц с различными каузальными графами, уровнями пропусков и шумом. Это позволило модели научиться обобщать закономерности без переобучения на специфические особенности реальных датасетов.
Результаты: Новый SOTA на TabArena
В сравнении с ведущими моделями на бенчмарке TabArena, Kumo Tabular занял первое место по общему рейтингу ELO. Модель демонстрирует баланс точности и скорости, превосходя аналоги по скорости инференса при сопоставимой или лучшей точности.
| Метрика / Характеристика | NVIDIA Kumo Tabular | Сравнение / Контекст |
|---|---|---|
| Рейтинг TabArena (ELO) | 1950 | 1-е место в общем зачете |
| Скорость инференса | В 17 раз быстрее LimiX-2 | При тестировании на одной RTX 6000 Pro |
| Размеры модели | 28M, 71M, 215M параметров | Масштабируемость под ресурсы |
| Тип задачи | Классификация и Регрессия | Zero-shot, без дообучения |
| Лицензия | OpenMDW-1.1 | Разрешает коммерческое использование |
Почему это важно
Табличные данные остаются основой корпоративного ML (финансы, логистика, IoT). Kumo Tabular предлагает альтернативу долгому циклу разработки ML-пайплайнов, позволяя решать новые задачи «на лету» путем подачи примеров в контекст. Это снижает порог входа для внедрения сложных моделей в промышленность.
Источник: Hugging Face blog ↗
