В мире анализа данных временные ряды (time series) всегда были отдельной, сложной дисциплиной. От прогнозирования спроса в ритейле до мониторинга нагрузки на энергосети и телеметрии промышленных датчиков — задачи требуют высокой точности и адаптивности. Традиционный подход к решению этих проблем заключался в обучении отдельной модели для каждого конкретного набора данных. Это дорого, долго и требует огромных вычислительных ресурсов. Однако эра фундаментальных моделей (foundation models) меняет правила игры. Вместо того чтобы тренировать систему с нуля под каждую задачу, разработчики теперь могут использовать предварительно обученные модели, которые способны выдавать точные прогнозы «на лету» (zero-shot), без дополнительной донастройки под конкретный датасет.
Именно этот шаг сделала IBM, выпустив Granite Time Series PatchTST-FM-r2. Это новейшая модель в семействе Granite TSFM, которая не просто улучшает предыдущие версии, но и устанавливает новые стандарты качества для моделей с открытым исходным кодом. Модель сочетает в себе обновленную архитектуру, увеличенный корпус для предварительного обучения, поддержку вероятностного прогнозирования и способность корректно обрабатывать пропущенные значения, оставаясь при этом компактной — всего около 385 миллионов параметров.
По состоянию на сентябрь 2026 года, PatchTST-FM-r2 является лидером среди моделей с разрешительной коммерческой лицензией (Apache 2.0 и OpenMDW 1.0) на авторитетном бенчмарке GIFT-Eval. Это означает, что компании могут использовать эту технологию в коммерческих продуктах без юридических рисков, получая при этом точность, сопоставимую с закрытыми проприетарными решениями. В этой статье мы подробно разберем, что изменилось в архитектуре, как модель показала себя в тестах и как вы можете запустить ее в своих проектах уже сегодня.

01Почему zero-shot прогнозирование — это прорыв?
Термин «zero-shot» (ноль примеров) в контексте временных рядов означает способность модели генерировать качественные прогнозы для данных, которые она никогда не видела в процессе обучения. Раньше, если вы хотели предсказать продажи нового товара или нагрузку на новый сервер, вам нужно было собирать исторические данные, очищать их, выбирать алгоритм (ARIMA, Prophet, LSTM) и обучать модель неделями. Если данных было мало, модель переобучалась и давала плохие результаты.
Фундаментальные модели временных рядов решают эту проблему. Они обучаются на огромных массивах разнородных данных, выявляя общие паттерны, тренды и сезонности, характерные для большинства временных рядов. В результате, когда вы подаете на вход новую последовательность, модель уже «знает», как вести себя в типичных ситуациях. Это снижает порог входа для внедрения AI в бизнес-процессы. Инженерам больше не нужно быть экспертами в статистике для каждого нового кейса — достаточно правильно подготовить данные и вызвать API или запустить локальный инференс.
IBM подчеркивает, что главная ценность таких моделей — в их обобщающей способности. Если модель работает хорошо на данных, которых не было в обучающей выборке, значит, она действительно научилась понимать природу временных рядов, а не просто зазубрила ответы. Именно поэтому фокус в статье IBM сделан на метриках zero-shot производительности.
02Результаты на бенчмарке GIFT-Eval: Лидер среди открытых моделей
Для объективной оценки качества прогнозирования IBM использует бенчмарк GIFT-Eval (Generalized In-Forecasting Time-series Evaluation). Это комплексная платформа, которая тестирует модели на разнообразных сценариях: от финансовых рынков до метеорологии. Ключевая особенность GIFT-Eval — строгий контроль за «утечкой данных» (data leakage). Многие закрытые модели могут нечестно завышать свои результаты, включая части тестовых датасетов в фазу предварительного обучения. GIFT-Eval исключает такие модели из категории «zero-shot».

Результаты PatchTST-FM-r2 впечатляют. На диаграммах ниже представлены две ключевые метрики:
- CRPS (Continuous Ranked Probability Score): Оценивает качество вероятностного прогноза. Чем ниже значение, тем точнее распределение предсказаний совпадает с реальностью.
- MASE (Mean Absolute Scaled Error): Измеряет абсолютную ошибку, масштабированную относительно простого наивного прогноза. Также, чем ниже, тем лучше.
Как видно из данных бенчмарка, PatchTST-FM-r2 занимает 2-е место среди всех воспроизводимых zero-shot моделей по обоим показателям. Геометрическое среднее CRPS составляет 0.467, а MASE — 0.6846. Однако самое важное достижение заключается в том, что среди моделей, имеющих разрешительную коммерческую лицензию (что критично для бизнеса), эта модель является абсолютным лидером. Модель TimesFM-3 показывает чуть лучшие результаты, но ее лицензионные условия могут быть менее гибкими для некоторых корпоративных клиентов.

Даже если мы расширим сравнение и включим модели, которые имели доступ к обучающим данным бенчмарка (pretrained models), PatchTST-FM-r2 остается в топ-4. Она превосходит такие известные модели, как Chronos-2, Timer-S1 и вариации Toto, несмотря на то, что некоторые из них имеют значительно больший размер. Это говорит о высокой эффективности архитектуры и качества обучающих данных IBM.

03Архитектура PatchTST-FM-r2: От Transformer к Conformer
Что позволило IBM достичь таких результатов, не увеличивая катастрофически размер модели? Секрет кроется в фундаментальном изменении внутренней архитектуры по сравнению с версией r1. Если r1 использовала стандартные трансформерные блоки, то r2 перешла на Conformer-блоки.
Конформеры изначально были разработаны для обработки речи, где важно учитывать как локальные особенности звука (фонемы), так и глобальный контекст предложения. В контексте временных рядов это работает аналогично:
- Многоголовое самовнимание (Multi-head Self-Attention): Позволяет модели улавливать долгосрочные зависимости. Например, связь между пиковой нагрузкой сегодня и аналогичным пиком год назад.
- Временная свертка (Temporal Convolution): Добавляет индуктивное смещение (inductive bias) к локальной структуре. Сворачивая данные, модель лучше улавливает краткосрочные тренды, шум и локальные аномалии, которые могут «потеряться» при глобальном внимании.
В архитектуре r2 каждый блок состоит из двух полушаговых полносвязных слоев, окружающих механизм внимания, и слоя временной свертки. Сворачивающие слои используют чередующиеся размеры ядер 3 и 5, что позволяет модели гибко настраивать «взгляд» на локальные паттерны. Это освобождает механизм внимания от необходимости обрабатывать локальный шум, позволяя ему сосредоточиться на дальних зависимостях.
На визуализации паттернов внимания (см. рисунок ниже) это видно наглядно. В классическом трансформере (слева) внимание часто концентрируется вокруг диагонали, то есть модель смотрит в основном на соседние точки. В Conformer-блоке (справа) внимание становится более распределенным, с акцентом на дальние связи (вне диагонали), так как локальные задачи берет на себя свертка.

Дополнительные улучшения включают:
- 50% перекрытие патчей (Overlapping Patches): Данные разбиваются на фрагменты (патчи) с перекрытием, что сглаживает границы между ними и снижает артефакты прогнозирования.
- Взвешивание Хэмминга (Hamming-window weighting): Дополнительная сглаживающая техника на границах патчей.
- Метод Overlap-and-Add: Алгоритм объединения прогнозов с перекрытием для повышения точности.
- Нормализация и глубина: Количество блоков увеличено с 20 до 30, добавлена нормализация для стабильности обучения.
Итоговая модель имеет ~385 млн параметров, поддерживает контекст до 8192 шагов и предсказывает 99 квантилей, что дает полную картину неопределенности прогноза.
04Обучающие данные: Прозрачность для Enterprise
Для корпоративных клиентов, особенно в финансовом секторе и госсекторе, важно не только то, как хорошо работает модель, но и откуда она «взяла» знания. IBM предоставляет детальную документацию по корпусу данных для PatchTST-FM-r2:
- GiftEvalPretrain: Отборочные датасеты из набора GIFT-Eval, исключенные из тестовой выборки.
- Синтетические данные KernelSynth: Данные, сгенерированные с использованием модифицированных периодических ядер. Это позволяет модели учиться на идеализированных паттернах без шума реальных данных.
- TSMixup: Корпус, сгенерированный по методике Chronos, но строго ограниченный датасетами, не входящими в GIFT-Eval. Это предотвращает утечку знаний.
- CauKer Sequences: Около 500 000 синтетических последовательностей длиной 4096 шагов, созданных для расширения разнообразия паттернов.
05Лицензирование: Apache 2.0 и OpenMDW 1.0
Одним из главных барьеров для внедрения AI в бизнес является лицензионная неопределенность. Многие мощные модели имеют лицензии, запрещающие коммерческое использование, или требуют сложных соглашений. IBM решила эту проблему, выпустив PatchTST-FM-r2 под двойной лицензией:
- Apache 2.0: Одна из самых популярных открытых лицензий. Разрешает использование, модификацию и распространение, в том числе в коммерческих продуктах, с минимальными бюрократическими требованиями.
- OpenMDW 1.0: Лицензия от Linux Foundation, специально разработанная для моделей машинного обучения. Она предоставляет четкие рамки для использования AI-моделей и связанных материалов, закрывая многие юридические пробелы, характерные для традиционных open-source лицензий.
Пользователи могут выбрать любую из этих лицензий. Это снижает барьеры для внедрения и дает уверенность исследователям и разработчикам, что они могут строить на базе Granite TSFM свои продукты без страха получить иск.
06Как запустить модель: Пример кода
Самое приятное в экосистеме Hugging Face и IBM — это простота интеграции. Вам не нужно писать сложный код для загрузки весов или настройки пайплайнов. Все доступно через стандартные библиотеки Python.
Сначала установите пакет:
pip install "granite-tsfm>=0.3.9"Затем загрузите модель и запустите прогноз. Обратите внимание, что модель работает в режиме zero-shot: вам не нужно ее дообучать (fine-tune). Вы просто подаете исторические данные, и она выдает прогноз.
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
# Загрузка весов модели
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
# Чтение примера данных (ETT dataset)
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"]
)
# Настройка пайплайна прогнозирования
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512, # Используем последние 512 точек
prediction_length=64, # Прогнозируем на 64 шага вперед
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9], # Квантили для оценки неопределенности
explode_forecasts=True,
freq="1h"
)
# Создание прогноза
forecast = pipe(df.iloc[-512:])В этом коде мы используем последние 512 наблюдений из часового датасета ETTh1, чтобы предсказать значения на следующие 64 часа. Модель возвращает не только точечный прогноз (медиану, квантиль 0.5), но и доверительные интервалы (квантили 0.1 и 0.9), что критически важно для оценки рисков в бизнесе.
07От ноутбуков к потоковой обработке: Интеграция с Confluent
Вышеприведенный пример хорош для анализа исторических данных или пакетной обработки. Но что делать, если данные поступают непрерывно, как поток (stream)? Например, данные с IoT-датчиков или транзакции в реальном времени.
IBM и Confluent разработали решение для таких сценариев. Через программу раннего доступа (Early Access) в Confluent Cloud доступны модели Granite Time Series, включая PatchTST-FM-r2. Интеграция работает на базе Apache Flink, что позволяет запускать инференс фундаментальных моделей непосредственно внутри потоковых приложений.
Это означает, что прогнозы и обнаружение аномалий могут генерироваться из живых потоков данных, без необходимости перемещать данные в отдельную ML-среду. Это снижает задержку (latency) и упрощает архитектуру системы. В портфель также входят модели FlowState-r1.1, TTM-r3 и TSPulse, что позволяет выбирать оптимальное решение под конкретную задачу.
08Что это значит на практике
Выпуск IBM Granite Time Series PatchTST-FM-r2 знаменует собой переход от нишевых экспериментов к промышленному стандарту в области прогнозирования временных рядов. Вот три ключевых вывода для специалистов:
- Снижение затрат на разработку: Вам больше не нужно обучать модель с нуля для каждого нового источника данных. Zero-shot подход позволяет развернуть систему прогнозирования за часы, а не недели.
- Безопасность для бизнеса: Лицензии Apache 2.0 и OpenMDW 1.0 делают модель полностью пригодной для коммерческого использования. Прозрачность обучающих данных снимает многие юридические риски.
- Высокая точность без компромиссов: Модель демонстрирует результаты, сопоставимые с закрытыми аналогами, благодаря инновационной архитектуре Conformer и качественному корпусу данных.
Для российских разработчиков и компаний, работающих с AI, эта модель представляет особый интерес. Благодаря открытому коду и весам, ее можно развернуть локально на собственных серверах, что обеспечивает независимость от зарубежных облачных сервисов и соответствие требованиям по локализации данных. Доступность через Hugging Face и GitHub делает процесс знакомства и внедрения максимально простым.
Рекомендуем начать с загрузки модели на Hugging Face и тестирования на ваших собственных данных. Простота API позволяет быстро оценить потенциал технологии, а масштабируемость через Confluent готова к работе в сложных производственных средах. Granite TSFM — это мощный инструмент, который делает передовое прогнозирование доступным для каждого.
Источник: Hugging Face ↗
