Лидер бенчмарка GIFT-Eval с открытой лицензией
Лаборатория IBM Research выпустила новую версию своей модели временных рядов — Granite Time Series PatchTST-FM-r2. Это фундаментальная модель (foundation model), предназначенная для zero-shot прогнозирования, что позволяет использовать её для предсказания на данных, не участвовавших в обучении, без дообучения. По состоянию на 8 сентября 2026 года модель занимает 1-е место в категории «реплицируемые zero-shot модели с коммерчески дружелюбной лицензией» на бенчмарке GIFT-Eval, а также входит в топ-2 среди всех реплицируемых моделей (без учета утечки данных из тестовых выборок).
Модель распространяется под двойной лицензией: Apache 2.0 и OpenMDW 1.0, что делает её пригодной для использования в коммерческих продуктах. Доступны веса, архитектура, код инференса и инструкции для воспроизведения результатов.
Архитектурные улучшения: от Transformer к Conformer
В отличие от предшественника PatchTST-FM-r1, новая версия использует Conformer-блоки, сочетающие механизм multi-head self-attention с временной свёрткой (temporal convolution). Это позволяет модели эффективно захватывать как долгосрочные зависимости (через attention), так и локальные временные структуры (через свёртку). Архитектура расширена с 20 до 30 блоков, используется перекрытие патчей на 50% с весами окна Хэмминга для сглаживания границ.
Ключевые характеристики и метрики
Модель поддерживает контекст до 8192 шагов и выдает вероятностные прогнозы через голову квантилей (99 квантилей). Ниже приведено сравнение позиций на бенчмарке GIFT-Eval:
| Метрика / Категория | Позиция PatchTST-FM-r2 | Примечание |
|---|---|---|
| Zero-shot (CRPS) | 2-е место (общее), 1-е (коммерч.) | Геометрическое среднее CRPS: 0.467 |
| Zero-shot (MASE) | 2-е место (общее), 1-е (коммерч.) | Геометрическое среднее MASE: 0.6846 |
| Все реплицируемые модели (CRPS) | 3-е место | Обгоняет Chronos-2, Timer-S1, Toto |
| Все реплицируемые модели (MASE) | 4-е место | Конкурирует с более крупными моделями |
Данные для обучения и применение
Корпус для предобучения включает данные из GIFT-EvalPretrain, синтетические данные (KernelSynth) и корпус TSMixup. IBM подчеркивает важность отсутствия утечки данных из тестовых наборов GIFT-Eval в обучающую выборку. Модель готова к интеграции в потоковые приложения через продукты Confluent и может применяться для прогнозирования спроса, цен, энергопотребления и трафика.
Источник: Hugging Face blog ↗
