Главная/Блог/Аналитика/TabPFN-3.5: Революция в табличных…
Аналитика10 мин чтения · 16 сентября 2026 г.

TabPFN-3.5: Революция в табличных данных и победа над Kaggle

Prior Labs представила TabPFN-3.5 — табличную фундаментальную модель, которая бьет победителя Kaggle 2015 года с настройками по умолчанию. Разбор архитектуры, бенчмарков и практического применения.

TabPFN-3.5: Революция в табличных данных и победа над Kaggle

В мире машинного обучения существует давняя иерархия: глубокое обучение царит над изображениями и текстом, но табличные данные долгое время оставались «серой зоной», где классические ансамбли (градиентный бустинг, случайные леса) держали монополию. Однако этот парадигмальный сдвиг начал меняться с появлением табличных фундаментальных моделей (Tabular Foundation Models). Компания Prior Labs, один из лидеров в этой нише, официально выпустила TabPFN-3.5 — новую версию своей флагманской модели, которая не просто улучшает показатели, а переписывает правила игры. Модель способна делать предсказания за один прямой проход (forward pass) без необходимости дообучения или тонкой настройки под каждый конкретный набор данных. По заявлениям разработчиков, TabPFN-3.5 занимает первое место сразу в семи ключевых табличных бенчмарках, демонстрируя результаты, которые ранее были достижимы только благодаря колоссальным усилиям команд экспертов.

Но самое интригующее в этом релизе — не сухие цифры с тестов, а конкретный исторический вызов. Отдельная демонстрация показывает, что TabPFN-3.5 превосходит решение-победителя легендарного соревнования Kaggle 2015 года, причем делает это с настройками по умолчанию (default settings). Это вызывает закономерный вопрос: как модель, обученная на синтетических данных, может превзойти решения, созданные годами вручную лучшими гроссмейстерами платформы? В этой статье мы подробно разберем архитектуру TabPFN-3.5, технические нововведения, результаты на бенчмарках и то, что это значит для практикующих data scientist'ов, особенно в условиях доступности из России.

01Контекст: Почему табличные данные — это особая каста?

Прежде чем погружаться в детали TabPFN-3.5, важно понять, почему табличные данные (tabular data) требуют отдельного подхода. В отличие от изображений, где пиксели имеют пространственную корреляцию, или текста, где важен контекст слов, табличные данные часто состоят из гетерогенных признаков: числовых, категориальных, временных рядов. Традиционные подходы, такие как XGBoost или LightGBM, десятилетиями были золотым стандартом благодаря своей эффективности и интерпретируемости. Однако они требуют значительных усилий по препроцессингу, выбору признаков (feature engineering) и тонкой настройке гиперпараметров.

Фундаментальные модели, такие как TabPFN, предлагают альтернативу: они обучаются на огромных массивах разнообразных табличных данных (в данном случае — синтетических, но репрезентативных) и учатся обобщать паттерны. Это позволяет им работать как «zero-shot» или «few-shot» решения: вы просто подаете данные, и модель выдает предсказание, минуя этап обучения. Это радикально сокращает время от идеи до прототипа. TabPFN-3.5 становится следующим шагом в эволюции этого подхода, увеличивая емкость модели и улучшая кодирование признаков.

02Вызов Otto: История, которая изменила всё

Чтобы оценить масштаб достижения TabPFN-3.5, нужно вернуться в 2015 год. Соревнование Otto Group Product Classification Challenge на платформе Kaggle стало одним из самых известных в истории табличного машинного обучения. В нем участвовало 3505 команд, соревнуясь за приз в $10,000. Задача заключалась в классификации продуктов на 9 категорий на основе 93 обезличенных числовых признаков. Метрика оценки — multi-class log loss, где меньшее значение лучше.

Победителем стал дуэт Гильермо Титерича и Станислава Семёнова, которые тогда занимали первое место в мировом рейтинге Kaggle Grandmasters. Их решение представляло собой сложный многослойный ансамбль из 36 моделей, построенных на вручную созданных признаках (hand-crafted features). Это был результат кропотливой работы экспертов, которые месяцами исследовали данные, создавали новые признаки и настраивали гиперпараметры. Их итоговый результат на приватном лидерборде составил 0.382.

Ник Эриксон (Nick Erickson), соавтор AutoGluon и исследователь в Prior Labs, годами пытался приблизиться к этому результату с помощью автоматизированных инструментов. В своей статье 2020 года AutoGluon занял 23-е место. Версия 1.0 в 2023 году поднялась на 14-е место, а версия 1.6 в августе 2026 года достигла 9-го места. Однако последние шаги были самыми сложными: переход с 50-го на 10-е место сократил log loss с 0.41 до 0.40, но достижение победного уровня 0.382 с 10-го места потребовало еще 0.018 улучшения — почти вдвое больше усилий, чем предыдущие шаги.

TabPFN-3.5: Революция в табличных данных и победа над Kaggle

TabPFN-3.5 решила эту задачу. Модель показала результат 0.375 на приватном лидерборде, превзойдя победителя 2015 года. И самое главное: это было сделано на «сырых» данных (raw data) с настройками по умолчанию. На видеокарте RTX PRO 6000 процесс занял около минуты. Модель была предварительно обучена исключительно на синтетических данных и никогда не видела данные Otto или любые другие датасеты Kaggle. Это доказывает, что фундаментальные модели могут обобщать знания лучше, чем специализированные решения, созданные под конкретную задачу.

💡
Важно знать. TabPFN-3.5 не видела данные Otto во время обучения. Ее способность превзойти решение, созданное экспертами с ручной обработкой признаков, говорит о мощи встроенных механизмов кодирования и инференса в контексте (in-context learning).

03Архитектурные изменения: Что изменилось под капотом?

Переход от TabPFN-3 к TabPFN-3.5 — это не просто итерация, а существенная переработка архитектуры. Разработчики внесли ряд ключевых изменений, которые позволили модели стать мощнее и универсальнее.

1. Увеличение емкости модели

Внутренний трансформер контекста (in-context transformer) был расширен с 512 до 1024 измерений. Количество параметров выросло с 53 миллионов (в TabPFN-3 для классификации) до 220 миллионов. Это позволяет модели улавливать более сложные и тонкие зависимости в данных. Несмотря на увеличение параметров, размер KV-cache (key-value cache) остался примерно таким же, как в TabPFN-3, что сохраняет скорость инференса для одиночных предсказаний.

2. Единый чекпоинт для классификации и регрессии

Ранее пользователям приходилось выбирать между моделями для классификации и регрессии. TabPFN-3.5 использует единый многозадачный чекпоинт, который справляется с обоими типами задач. Это упрощает развертывание и использование модели в реальных проектах, где тип задачи может меняться или быть неопределенным на старте.

3. Новое кодирование признаков (Cell Encodings)

Одним из самых важных нововведений стало внедрение новых методов кодирования значений. Теперь данные проходят через обучаемые функции Фурье (learned Fourier features) и ранги эмпирической функции распределения (in-context ECDF ranks). Ранги ECDF обладают важным свойством: они инвариантны к монотонным преобразованиям, таким как логарифмическое масштабирование. Это означает, что модель становится более устойчивой к разным способам представления числовых данных, что особенно полезно при работе с зашумленными или нестандартными данными.

4. Упрощение препроцессинга

В TabPFN-3.5 были удалены некоторые сложные шаги препроцессинга, такие как квантильная трансформация, робастное масштабирование и признаки SVD. Это делает модель более простой в использовании «из коробки». Пользователю больше не нужно писать сложные пайплайны обработки данных перед подачей их в модель.

TabPFN-3.5: Революция в табличных данных и победа над Kaggle

5. Масштабируемость и данные

Модель поддерживает до 1 миллиона строк, с рекомендуемым количеством признаков до 6000 и поддержкой до 20 000. Предварительное обучение теперь использует синтетические данные, которые специально сбалансированы для включения высокоразмерных, широких и сгруппированных таблиц. Это помогает модели лучше справляться с типичными проблемами реальных бизнес-данных.

⚠️
Производительность. Несмотря на увеличение параметров в 4 раза, скорость инференса для одиночных предсказаний осталась прежней. Однако на больших обучающих наборах базовая модель работает до 2 раз медленнее, чем TabPFN-3. Это компромисс за повышение точности.

04Результаты на бенчмарках: Лидерство по всем фронтам

Технический отчет Prior Labs демонстрирует впечатляющие результаты TabPFN-3.5 на ряде общепризнанных табличных бенчмарков. Модель занимает первое место в TabArena, BeyondArena, STRABLE, MulTaBench, RelArena-α, TALENT и ScoringBench. Важно отметить, что в некоторых случаях лучшее место занимает не базовая модель, а ее специализированные версии, такие как TabPFN-3.5-Thinking.

TabArena: Живой бенчмарк

TabArena — это динамический бенчмарк, включающий 51 набор данных. Здесь версия TabPFN-3.5-Thinking достигает рейтинга Эло 1910, что значительно выше базовой модели (1866) и предыдущего лидера TabFM+ (1823). Базовая модель TabPFN-3.5 превосходит AutoGluon 1.6 Extreme на 130 пунктов Эло, затрачивая при этом в пять раз меньше времени. Это подчеркивает эффективность подхода: высокая точность при минимальных вычислительных затратах.

BeyondArena: Сложные данные

Бенчмарк BeyondArena охватывает 142 набора данных, включая сгруппированные, временные, широкие, текстово-богатые и данные с высокой кардинальностью. TabPFN-3.5 финишировала примерно на 150 пунктов Эло выше предыдущего общего лидера. Однако стоит отметить, что на определенных срезах данных (сгруппированные, временные и большие наборы) модели MLP, настроенные и ансамблированные, все еще показывают лучшие результаты. Это указывает на то, что для специфических задач традиционные методы могут оставаться конкурентоспособными, но в целом TabPFN-3.5 задает новый стандарт.

📌
Факт. TabPFN-3.5-Thinking использует дополнительные вычислительные ресурсы во время инференса, но не использует LLM, реальные данные или поиск. Она работает до 12 раз быстрее, чем TabPFN-3-Thinking, предлагая баланс между точностью и скоростью.

05Семейство моделей: Выбор под задачу

Prior Labs выпустила не одну модель, а целое семейство TabPFN-3.5, каждое из которых оптимизировано под разные сценарии использования:

  • TabPFN-3.5 (Base): Открытые веса, 220 миллионов параметров, 8 оценщиков по умолчанию. Это универсальная модель для большинства задач.
  • TabPFN-3.5-Fast (Alpha): Открытые веса, 84 миллиона параметров. До 6 раз быстрее базовой модели. Идеально для сценариев, где скорость критична, а небольшая потеря в точности допустима.
  • TabPFN-3.5-Plus: Доступна только через API и для корпоративных клиентов. Добавляет нативную обработку текста и внимание FP8 (half-precision floating point), что может быть полезно для мультимодальных задач.
  • TabPFN-3.5-Thinking: Модель, которая тратит больше вычислений на инференс для повышения точности. Не использует LLM или поиск, но работает до 12 раз быстрее предыдущей версии Thinking.
TabPFN-3.5: Революция в табличных данных и победа над Kaggle

06Доступность и лицензирование: Что важно для разработчиков из РФ

Одним из ключевых вопросов для сообщества является лицензирование. TabPFN-3.5 имеет открытые веса (open weights), что позволяет запускать их локально для исследовательских целей, оценки и участия в соревнованиях (Kaggle). Однако для коммерческого использования в продакшене требуется API от Prior Labs или коммерческая лицензия.

Для разработчиков из России это создает определенные нюансы. Прямой доступ к API Prior Labs может быть ограничен из-за санкций или банковских ограничений. Однако возможность локального запуска модели с открытыми весами остается мощным инструментом. Это позволяет компаниям и исследователям использовать передовые технологии без зависимости от зарубежных облачных сервисов. Важно отметить, что локальный запуск требует достаточных вычислительных ресурсов, особенно для версии Base с 220 миллионами параметров.

💡
Совет. Если вы планируете использовать TabPFN-3.5 в коммерческом проекте, обязательно изучите условия лицензирования Prior Labs. Для исследовательских задач и прототипирования локальный запуск с открытыми весами — отличный вариант.

07Что это значит на практике

Релиз TabPFN-3.5 знаменует собой новый этап в развитии табличного машинного обучения. Вот несколько ключевых выводов для практикующих специалистов:

  1. Сокращение времени на прототипирование: Возможность получать результаты, сопоставимые с ручным инжинирингом признаков, за минуты, а не дни, ускоряет цикл разработки. Это особенно ценно в стартапах и исследовательских проектах.
  2. Снижение порога входа: Упрощенный препроцессинг и настройка по умолчанию делают мощные модели доступными для специалистов с меньшим опытом в тонкой настройке моделей.
  3. Конкуренция с традиционными методами: TabPFN-3.5 доказывает, что фундаментальные модели могут превосходить специализированные ансамбли, такие как XGBoost, в сложных задачах. Это заставляет пересмотреть стандартные пайплайны.
  4. Локальный запуск: Доступность весов позволяет использовать модель в условиях изолированных сетей или при наличии строгих требований к безопасности данных.

TabPFN-3.5 — это не просто еще одна модель. Это демонстрация того, как фундаментальные модели могут решать задачи, которые ранее требовали экспертных знаний и огромных вычислительных ресурсов. Для сообщества AI это сигнал к тому, что табличные данные больше не являются «второстепенной» задачей, а становятся ареной для инноваций, сравнимых с достижениями в CV и NLP.

Для тех, кто хочет глубже погрузиться в технические детали, Prior Labs опубликовала технический отчет и технические спецификации. Все заслуги в разработке этой модели принадлежат команде исследователей Prior Labs. Рекомендуем следить за обновлениями на их платформах и в сообществе ML, так как развитие табличных фундаментальных моделей будет определять тренды в машинном обучении на ближайшие годы.

Источник: MarkTechPost ↗