В мире искусственного интеллекта табличные данные остаются «темной материей»: они повсюду, критически важны для бизнеса, но часто игнорируются в погоне за генеративными моделями для текста и изображений. Однако ситуация стремительно меняется. Компания Nums AI официально представила Causilo — новую табличную фундаментальную модель (Tabular Foundation Model), предназначенную для задач классификации и регрессии. Это не просто еще одна нейросеть; это прорыв в архитектуре, который позволяет работать с табличными данными так же гибко, как мы работаем с текстом в LLM, но с учетом специфики структурированных данных.
Causilo выделяется не только своими выдающимися результатами, но и доступностью. Модель поставляется с открытым кодом под лицензией Apache 2.0, предобученными весами на Hugging Face и, что особенно важно для практикующих инженеров, с привычным интерфейсом scikit-learn. Это означает, что вы можете использовать Causilo в своих существующих пайплайнах машинного обучения практически без переписывания кода. На авторитетном соревновании TabArena модель показала наивысший рейтинг Эло среди одиночных моделей как для задач классификации, так и для регрессии.
Но как это работает на самом деле? Можно ли использовать Causilo в продакшене прямо сейчас? И почему ее архитектура, основанная на обучении в контексте (in-context learning), меняет правила игры? В этой статье мы подробно разберем технические детали, результаты бенчмарков и практические аспекты внедрения этой инновационной модели.
01Что такое Causilo и как она работает?
В основе Causilo лежит концепция обучения в контексте (in-context learning). Это ключевое отличие от традиционных нейросетей, которые обновляют свои веса в процессе обучения (fit). Когда вы вызываете метод fit для Causilo, модель не обновляет свои предобученные веса. Вместо этого она сохраняет обучающие выборки в качестве контекста и предсказывает значения для новых строк за один прямой проход (forward pass). Это напоминает то, как большие языковые модели используют промпты, но адаптировано для табличных данных.
Модель поддерживает входные данные в форматах NumPy массивов или pandas DataFrames, что делает ее совместимой с большинством инструментов анализа данных. Она корректно обрабатывает категориальные признаки и пропущенные значения (missing values), что является частой проблемой в реальных данных. Для задач классификации поддерживается до 10 классов, а для регрессии по умолчанию возвращаются средние предсказания. Однако в версии 1.0.1 добавлена поддержка медианы и квантилей (на основе 999 нативных квантилей), что значительно расширяет возможности для оценки неопределенности в прогнозах.
02Архитектура: Три фазы обработки
Архитектура Causilo — это результат тщательного проектирования, разделенного на три основные фазы: уточнение (refinement), сжатие (compression) и обучение в контексте (in-context learning). Давайте разберем каждую из них, чтобы понять, как модель обрабатывает информацию.
1. Уточнение (Refinement)
На этом этапе происходит первичная обработка признаков. Признаки группируются в наборы по три элемента. Каждое значение в наборе кодируется с помощью 16 выученных синусоидальных и косинусоидальных частот. Это позволяет модели эффективно захватывать нелинейные зависимости и периодичности в данных. Особое внимание уделено пропущенным значениям: для них выделены собственные выученные векторы, что позволяет модели «понимать», что значение отсутствует, а не просто игнорировать его.

2. Сжатие (Compression)
После уточнения данные проходят через два столбцовых этапа (column stages). На каждом этапе 128 латентных слотов (latent slots) считывают только обучающие строки и передают эту сводку каждой строке. Между этими двумя столбцовыми этапами находится этап строк (row stage), который позволяет группам признаков взаимодействовать через 4 латентных токена. Ключевая особенность здесь — использование кросс-внимания (cross-attention) вместо полного самовнимания (full self-attention). По словам разработчиков из Nums AI, это сохраняет вычислительную стоимость линейной относительно количества признаков, что критически важно для масштабируемости.
Затем блок пулинга (pooling block) сжимает каждую строку в фиксированный вектор размерностью 512 измерений. К этим векторам добавляются метки (labels) обучающих строк, формируя контекст, к которому будут обращаться запросы.
3. Обучение в контексте (In-Context Learning)
Финальная фаза — это блок предсказания из 12 слоев. Строки запроса (query rows) могут обращаться к строкам с метками (labeled rows), но не могут изменять обучающий контекст или взаимодействовать друг с другом. Это гарантирует, что предсказания основываются исключительно на выученных паттернах из обучающей выборки, сохраненной в контексте.
По умолчанию используется ансамбль из 8 членов (ensemble members), которые разделяют одни и те же веса. Каждый член ансамбля циклически проходит через различные нормализации (none, rank2gaussian, robust, power) и перестановки признаков и классов, что повышает устойчивость и точность модели.
03Результаты на TabArena: Лидер среди одиночных моделей
TabArena — это один из самых авторитетных бенчмарков для табличных моделей машинного обучения. Nums AI использовала официальный пайплайн TabArena, который включает 51 датасет и 816 полных разделов (Full splits), с 8 оценщиками и фиксированным сидом 42. Независимый повторный запуск оценки, проведенный одним из сопровождающих TabArena, подтвердил общий рейтинг Эло Causilo на уровне 1794.
Вот как Causilo выглядит на фоне конкурентов:

- Общий рейтинг: Causilo — 1792.9. Следующая лучшая одиночная модель, TabFM, имеет рейтинг 1764.4. Разрыв составляет почти 30 пунктов Эло, что является значительным преимуществом.
- Классификация: Causilo — 1771.8. EXAONE Tabular от LG AI Research занимает второе место с 1758.8.
- Регрессия: Causilo — 2032.6. TabFM идет следом с 1992.8. Здесь преимущество Causilo особенно заметно.
Для сравнения, другие известные модели, такие как TabPFN-3 от Prior Labs (1636.2 в общем зачете), значительно отстают. Также стоит отметить, что Xiaomi-TabLDM и Amazon’s Mitra-v2 упоминаются Nums AI как находящиеся позади Causilo, хотя эти модели не представлены в файлах бенчмарков в репозитории Causilo.
04ScoringBench: Точность в регрессии
Помимо TabArena, Causilo была протестирована на ScoringBench, который оценивает модели регрессии с использованием правильных правил оценки, таких как CRPS (Continuous Ranked Probability Score), наряду с RMSE и R². Nums AI представила версию Causilo 1.0.1 на 101 датасете, по 5 фолдов на каждый, с ограничением в 3000 образцов. Результаты показали, что Causilo заняла 1-е место по всем трем метрикам: CRPS, R² и RMSE. Эти результаты были независимо проверены сопровождающим ScoringBench перед их официальным утверждением.
05Скорость и потребление памяти
Одной из сильных сторон Causilo является ее эффективность. Nums AI провела повторные тесты трех моделей на одном GPU H100 (80 ГБ) с 8 ядрами CPU на задачу. Вот сравнительные данные:
- Causilo: 2.504 сек на 1k строк для fit, 0.251 сек на 1k строк для predict, 8.15 ГБ памяти GPU.
- TabICLv2: 3.449 сек для fit, 0.303 сек для predict, 8.37 ГБ памяти.
- TabPFN-3: 4.18 сек для fit, 0.686 сек для predict, 0.88 ГБ памяти.
Causilo демонстрирует самую высокую скорость как на этапе fit, так и на этапе predict. Однако TabPFN-3 использует значительно меньше памяти GPU. Важно отметить, что установка параметра use_kv_cache=True переносит работу с контекстом на этап fit, увеличивая потребление памяти, но значительно ускоряя повторные предсказания. Это делает Causilo отличным выбором для сценариев, где требуется быстрая обработка множества запросов после начального обучения.

use_kv_cache=True. Это позволит вам «заплатить» памятью один раз при fit, чтобы получить молниеносные предсказания в дальнейшем.06Как начать работу с Causilo
Для использования Causilo требуется Python 3.10–3.12 и PyTorch 2.13 или новее. Установка и использование модели максимально упрощены благодаря интеграции с scikit-learn. Первый вызов fit автоматически загружает чекпоинт.
# pip install causilo
from causilo import CausiloClassifier, CausiloRegressor
# Классификация
clf = CausiloClassifier(n_estimators=8, random_state=42)
clf.fit(X_train, y_train)
proba = clf.predict_proba(X_test)
# Регрессия
reg = CausiloRegressor()
reg.fit(X_train, y_train)
# Предсказание квантилей
bands = reg.predict(X_test, output_type="quantiles", quantiles=[0.05, 0.5, 0.95])Вы также можете попробовать модель через демо-пространство на Hugging Face. Код модели доступен на GitHub под лицензией Apache 2.0, а веса — на Hugging Face. Однако обратите внимание: для коммерческого, производственного использования или использования в виде хостингового API требуется отдельная лицензия от Nums AI. Для исследовательских целей и оценки модель доступна бесплатно.
07Что это значит на практике
Появление Causilo знаменует собой новый этап в развитии табличного машинного обучения. Ее способность достигать состояния «state-of-the-art» без необходимости дообучения на конкретных датасетах (благодаря in-context learning) открывает новые возможности для быстрого прототипирования и внедрения ИИ в бизнес-процессы. Инженеры могут теперь использовать мощь фундаментальных моделей, не тратя недели на настройку гиперпараметров и сборку ансамблей.
Однако важно помнить о лицензионных ограничениях. Если вы планируете использовать Causilo в коммерческих продуктах, вам необходимо связаться с Nums AI для получения соответствующей лицензии. Для исследовательских проектов, академических работ и внутренних экспериментов Causilo представляет собой бесценный ресурс, особенно учитывая ее открытость и высокую производительность.
В заключение, Causilo от Nums AI — это не просто еще одна модель в списке бенчмарков. Это демонстрация того, как правильно спроектированная архитектура, сочетающая эффективность вычислений и мощь обучения в контексте, может решить одни из самых сложных задач в анализе табличных данных. Следите за обновлениями, так как эта модель, вероятно, станет новым стандартом для многих задач машинного обучения в ближайшие годы.
Источник: MarkTechPost ↗
