Революция в табличных данных: Zero-Shot против XGBoost
Классический подход к работе с табличными данными — настройка градиентного бустинга (GBDT, например, XGBoost) — сталкивается с серьезной конкуренцией со стороны так называемых «табличных LLM» (Tabular LLMs). Согласно данным бенчмарка TabArena (снимок от 15 июля 2026 года), все лучшие одиночные модели, превышающие результаты наилучших настроенных ансамблей GBDT, являются именно предобученными трансформерами. Это инвертирует парадигму последних десятилетий, где деревья решений были безоговорочными лидерами.
Ключевым игроком здесь выступает модель TabICLv2 от команды SODA (Inria). Она работает по принципу zero-shot: модель не дообучается на ваших данных. Вместо этого вы подаете ей обучающие примеры как контекст, и она предсказывает метки для новых строк за один проход (forward pass). Это похоже на обучение в контексте (in-context learning), но для структурированных данных.
Архитектура TabICLv2: Как это работает
Несмотря на название «LLM», это не языковая модель. У нее нет фиксированного словаря токенов, так как столбцы таблиц могут быть любыми. Предобучение происходило на миллионах синтетических таблиц, сгенерированных случайными структурными причинно-следственными моделями (SCM). Архитектура TabICLv2 состоит из трех основных этапов:
- Встраивание ячеек (Set Transformer): Модель обрабатывает каждый столбец как неупорядоченное множество значений. Она понимает контекст числа: например, «450» в столбце «Цена» и «450» в столбце «Почтовый индекс» получают разные эмбеддинги, так как распределения признаков различаются.
- Агрегация строк: Для каждой строки 4 токена CLS (classification tokens) собирают информацию о признаках, используя позиционное кодирование RoPE (Rotary Position Embeddings), чтобы сохранить идентичность каждого столбца.
- Внимание к обучающим данным: Двенадцать блоков внимания позволяют каждой тестовой строке «смотреть» только на обучающие строки с известными метками. Используется механизм QASSMax для поддержания четкости внимания по мере роста объема обучающих данных.
Репродукция результатов: 28M параметров против энsembles
Автор оригинального исследования провел независимую проверку модели TabICLv2 на собственном оборудовании (одна видеокарта AWS A10G). Результаты подтвердили заявленные характеристики:
- Размер модели: всего 28 миллионов параметров (для сравнения, текстовая модель t0-alpha имеет 102 млн, а современные LLM — миллиарды).
- Точность: Elo-рейтинг модели составил 1559 против официального 1575 на бенчмарке. Разница находится в пределах статистической погрешности (±60–86 интервалы.bootstrap).
- Совпадение метрик: В 16 из 51 теста значения метрик совпали с точностью до 4 знаков после запятой. Медианное относительное расхождение составило всего 0,08%.
- Стоимость: Полный цикл воспроизведения занял 2,1 часа на GPU и обошелся менее чем в $2.
Сравнение с другими подходами
Табличные трансформеры конкурируют не только с деревьями, но и с другими методами. Ниже приведено сравнение ключевых игроков на момент публикации (июль 2026 года).
| Модель | Тип | Параметры | Статус весов | Примечание |
|---|---|---|---|---|
| TabICLv2 | Tabular LLM (Inria) | ~28M | Open Weights | Лидер среди открытых моделей, высокая воспроизводимость |
| TabFM | Tabular LLM (Google) | Не указано | Закрытые | Топ бенчмарка, но нет открытой статьи/кода |
| TabPFN | Tabular LLM (Prior Labs) | Не указано | Open Weights | Пионер направления, предшественник TabICL |
| XGBoost / LightGBM | Gradient Boosted Trees | Зависит от данных | Open Source | Требует дообучения и поиска гиперпараметров. Elo ниже на 150+ пунктов при сравнимых затратах на инференс |
| TabLLM | Text LLM + Prompting | Миллиарды | Разные | Серилизация таблицы в текст. Проигрывает нативным табличным моделям в 43 из 49 случаев |
Почему это важно
Появление эффективных табличных foundation-моделей меняет экономику машинного обучения. Если раньше для каждой новой задачи требовалось время на сбор данных, очистку и настройку гиперпараметров (что может занимать часы или дни), то теперь задача сводится к инференсу. Модель TabICLv2 демонстрирует, что даже с крошечным количеством параметров можно достичь состояния-of-the-art, если архитектура правильно учитывает природу табличных данных (отсутствие порядка строк, гетерогенность столбцов). Это открывает путь к мгновенному прототипированию ML-решений для бизнеса без необходимости нанимать узких специалистов по настройке GBDT.
Источник: Towards Data Science ↗
