Конец эпохи ручного тюнинга?
Google Research представила TabFM — первую фундаментальную модель (foundation model), предназначенную специально для работы с табличными данными. В отличие от традиционных подходов, где дата-сайентисты тратят часы на feature engineering и подбор гиперпараметров для XGBoost или Random Forest, TabFM использует парадигму zero-shot in-context learning (ICL).
Суть метода проста: модель получает всю таблицу (и обучающие примеры, и целевые строки) в виде единого промпта. Она не обновляет свои веса, а «учится» на лету, интерпретируя связи между строками и столбцами непосредственно во время инференса. Это позволяет получать качественные предсказания для ранее невиданных таблиц за один forward pass.
Архитектура: гибрид TabPFN и TabICL
Табличные данные двумерны и не имеют фиксированного порядка строк или столбцов, что делает их сложными для стандартных трансформеров. TabFM решает эту проблему через гибридную архитектуру с тремя ключевыми механизмами:
- Чередующееся внимание (Alternating attention): Модель последовательно обрабатывает строки и столбцы, выявляя сложные взаимодействия признаков без ручного конструирования фич.
- Сжатие строк (Row compression): Информация из каждого ряда сжимается в плотный вектор, что снижает вычислительную нагрузку.
- ICL на сжатых эмбеддингах: Финальный трансформер работает уже не с сырой сеткой данных, а с последовательностью сжатых векторов, что обеспечивает высокую скорость работы даже на больших наборах данных.
Обучение на синтетических данных
Главная проблема табличного ML — нехватка качественных открытых датасетов промышленного масштаба. Чтобы преодолеть это, TabFM обучена исключительно на сотнях миллионов синтетических датасетов. Эти данные генерируются динамически с использованием структурных каузальных моделей (SCM), что позволяет модели увидеть огромное разнообразие распределений и сложных зависимостей, характерных для реальных индустриальных задач.
Результаты бенчмарков TabArena
Модель протестирована на живом бенчмарке TabArena, который оценивает модели по рейтингу Эло. Тестирование охватило 38 датасетов для классификации и 13 для регрессии (от 700 до 150 000 строк). Были оценены две конфигурации: базовая TabFM (out-of-the-box) и TabFM-Ensemble (с использованием SVD и Platt scaling).
| Конфигурация | Особенности | Требования к ресурсам |
|---|---|---|
| TabFM | Zero-shot, один forward pass, без тюнинга | Минимальные, готово к использованию сразу |
| TabFM-Ensemble | 32-модельный ансамбль, SVD-фичи, Platt scaling | Выше вычислительная нагрузка, но максимальная точность |
Результаты показывают, что TabFM стабильно превосходит сильно настроенные традиционные алгоритмы, такие как XGBoost, предлагая баланс между скоростью развертывания и точностью.
Интеграция в Google BigQuery
Для упрощения внедрения TabFM интегрируется непосредственно в Google BigQuery. В ближайшие недели пользователи смогут выполнять продвинутую регрессию и классификацию, используя простую SQL-команду AI.PREDICT. Это делает мощь foundation-моделей доступной для аналитиков без глубоких знаний в машинном обучении.
Модель уже доступна на Hugging Face и GitHub.
Источник: Research ↗
