Релиз модели3 июля 2026 г., 15:45 МСК🤖 Auto

Google представил TabFM: zero-shot модель для табличных данных

Google Research выпустила TabFM — фундаментальную модель для классификации и регрессии, которая заменяет ручную настройку XGBoost одним проходом через контекст.

Баннер новости 2851

Конец эпохи ручного тюнинга?

Google Research представила TabFM — первую фундаментальную модель (foundation model), предназначенную специально для работы с табличными данными. В отличие от традиционных подходов, где дата-сайентисты тратят часы на feature engineering и подбор гиперпараметров для XGBoost или Random Forest, TabFM использует парадигму zero-shot in-context learning (ICL).

Суть метода проста: модель получает всю таблицу (и обучающие примеры, и целевые строки) в виде единого промпта. Она не обновляет свои веса, а «учится» на лету, интерпретируя связи между строками и столбцами непосредственно во время инференса. Это позволяет получать качественные предсказания для ранее невиданных таблиц за один forward pass.

Архитектура: гибрид TabPFN и TabICL

Табличные данные двумерны и не имеют фиксированного порядка строк или столбцов, что делает их сложными для стандартных трансформеров. TabFM решает эту проблему через гибридную архитектуру с тремя ключевыми механизмами:

  • Чередующееся внимание (Alternating attention): Модель последовательно обрабатывает строки и столбцы, выявляя сложные взаимодействия признаков без ручного конструирования фич.
  • Сжатие строк (Row compression): Информация из каждого ряда сжимается в плотный вектор, что снижает вычислительную нагрузку.
  • ICL на сжатых эмбеддингах: Финальный трансформер работает уже не с сырой сеткой данных, а с последовательностью сжатых векторов, что обеспечивает высокую скорость работы даже на больших наборах данных.

Обучение на синтетических данных

Главная проблема табличного ML — нехватка качественных открытых датасетов промышленного масштаба. Чтобы преодолеть это, TabFM обучена исключительно на сотнях миллионов синтетических датасетов. Эти данные генерируются динамически с использованием структурных каузальных моделей (SCM), что позволяет модели увидеть огромное разнообразие распределений и сложных зависимостей, характерных для реальных индустриальных задач.

Результаты бенчмарков TabArena

Модель протестирована на живом бенчмарке TabArena, который оценивает модели по рейтингу Эло. Тестирование охватило 38 датасетов для классификации и 13 для регрессии (от 700 до 150 000 строк). Были оценены две конфигурации: базовая TabFM (out-of-the-box) и TabFM-Ensemble (с использованием SVD и Platt scaling).

Конфигурация Особенности Требования к ресурсам
TabFM Zero-shot, один forward pass, без тюнинга Минимальные, готово к использованию сразу
TabFM-Ensemble 32-модельный ансамбль, SVD-фичи, Platt scaling Выше вычислительная нагрузка, но максимальная точность

Результаты показывают, что TabFM стабильно превосходит сильно настроенные традиционные алгоритмы, такие как XGBoost, предлагая баланс между скоростью развертывания и точностью.

Интеграция в Google BigQuery

Для упрощения внедрения TabFM интегрируется непосредственно в Google BigQuery. В ближайшие недели пользователи смогут выполнять продвинутую регрессию и классификацию, используя простую SQL-команду AI.PREDICT. Это делает мощь foundation-моделей доступной для аналитиков без глубоких знаний в машинном обучении.

Модель уже доступна на Hugging Face и GitHub.

Источник: Research ↗