Релиз модели25 июля 2026 г., 19:16 МСК🤖 Auto

TabICLv2: 28M параметров бьют XGBoost в zero-shot

Новая архитектура TabICLv2 от Inria SODA демонстрирует, что табличные трансформеры могут предсказывать целевые переменные без дообучения, превосходя градиентный бустинг на бенчмарке TabArena.

Баннер новости 4382

Революция в табличных данных: Zero-Shot против XGBoost

Классический подход к работе с табличными данными — настройка градиентного бустинга (GBDT, например, XGBoost) — сталкивается с серьезной конкуренцией со стороны так называемых «табличных LLM» (Tabular LLMs). Согласно данным бенчмарка TabArena (снимок от 15 июля 2026 года), все лучшие одиночные модели, превышающие результаты наилучших настроенных ансамблей GBDT, являются именно предобученными трансформерами. Это инвертирует парадигму последних десятилетий, где деревья решений были безоговорочными лидерами.

Ключевым игроком здесь выступает модель TabICLv2 от команды SODA (Inria). Она работает по принципу zero-shot: модель не дообучается на ваших данных. Вместо этого вы подаете ей обучающие примеры как контекст, и она предсказывает метки для новых строк за один проход (forward pass). Это похоже на обучение в контексте (in-context learning), но для структурированных данных.

Архитектура TabICLv2: Как это работает

Несмотря на название «LLM», это не языковая модель. У нее нет фиксированного словаря токенов, так как столбцы таблиц могут быть любыми. Предобучение происходило на миллионах синтетических таблиц, сгенерированных случайными структурными причинно-следственными моделями (SCM). Архитектура TabICLv2 состоит из трех основных этапов:

  • Встраивание ячеек (Set Transformer): Модель обрабатывает каждый столбец как неупорядоченное множество значений. Она понимает контекст числа: например, «450» в столбце «Цена» и «450» в столбце «Почтовый индекс» получают разные эмбеддинги, так как распределения признаков различаются.
  • Агрегация строк: Для каждой строки 4 токена CLS (classification tokens) собирают информацию о признаках, используя позиционное кодирование RoPE (Rotary Position Embeddings), чтобы сохранить идентичность каждого столбца.
  • Внимание к обучающим данным: Двенадцать блоков внимания позволяют каждой тестовой строке «смотреть» только на обучающие строки с известными метками. Используется механизм QASSMax для поддержания четкости внимания по мере роста объема обучающих данных.

Репродукция результатов: 28M параметров против энsembles

Автор оригинального исследования провел независимую проверку модели TabICLv2 на собственном оборудовании (одна видеокарта AWS A10G). Результаты подтвердили заявленные характеристики:

  • Размер модели: всего 28 миллионов параметров (для сравнения, текстовая модель t0-alpha имеет 102 млн, а современные LLM — миллиарды).
  • Точность: Elo-рейтинг модели составил 1559 против официального 1575 на бенчмарке. Разница находится в пределах статистической погрешности (±60–86 интервалы.bootstrap).
  • Совпадение метрик: В 16 из 51 теста значения метрик совпали с точностью до 4 знаков после запятой. Медианное относительное расхождение составило всего 0,08%.
  • Стоимость: Полный цикл воспроизведения занял 2,1 часа на GPU и обошелся менее чем в $2.

Сравнение с другими подходами

Табличные трансформеры конкурируют не только с деревьями, но и с другими методами. Ниже приведено сравнение ключевых игроков на момент публикации (июль 2026 года).

Модель Тип Параметры Статус весов Примечание
TabICLv2 Tabular LLM (Inria) ~28M Open Weights Лидер среди открытых моделей, высокая воспроизводимость
TabFM Tabular LLM (Google) Не указано Закрытые Топ бенчмарка, но нет открытой статьи/кода
TabPFN Tabular LLM (Prior Labs) Не указано Open Weights Пионер направления, предшественник TabICL
XGBoost / LightGBM Gradient Boosted Trees Зависит от данных Open Source Требует дообучения и поиска гиперпараметров. Elo ниже на 150+ пунктов при сравнимых затратах на инференс
TabLLM Text LLM + Prompting Миллиарды Разные Серилизация таблицы в текст. Проигрывает нативным табличным моделям в 43 из 49 случаев

Почему это важно

Появление эффективных табличных foundation-моделей меняет экономику машинного обучения. Если раньше для каждой новой задачи требовалось время на сбор данных, очистку и настройку гиперпараметров (что может занимать часы или дни), то теперь задача сводится к инференсу. Модель TabICLv2 демонстрирует, что даже с крошечным количеством параметров можно достичь состояния-of-the-art, если архитектура правильно учитывает природу табличных данных (отсутствие порядка строк, гетерогенность столбцов). Это открывает путь к мгновенному прототипированию ML-решений для бизнеса без необходимости нанимать узких специалистов по настройке GBDT.

Источник: Towards Data Science ↗