Прорыв без агентов и LLM
В мире, где трендом стало использование больших языковых моделей и агентов для анализа временных рядов, команда исследователей Nathan Thierry и Andre-Louis Rochet представила альтернативу — TW3Cast. Система заняла 3-е место из 130 участников на бенчмарке GIFT-Eval по среднему рангу MASE (Mean Absolute Scaled Error). Главное отличие: TW3Cast не использует ни агентов, ни языковых моделей для рассуждений. Вместо этого она опирается на «замороженную» таблицу маршрутизации, которая выбирает оптимальную модель на основе данных обучающей выборки.
Архитектура: 97 конфигураций и 4 режима
Система обрабатывает 97 различных конфигураций датасетов, частот и горизонтов прогнозирования. Для каждой конфигурации таблица маршрутизации выбирает один из четырех режимов работы:
- Специалист (Specialist): LoRA или полная дообученная версия базовых моделей (Chronos-2, TiRex, Toto). Данные для них очищались и обогащались по явным правилам.
- Квантильный бленд (Quantile blend): Содержит специалиста.
- Бленд базовых моделей (Blend of base models): Комбинация исходных моделей без дообучения.
- Турнир (Selection tournament): Выбор лучшей модели на бэк-тесте, вырезанном из обучающей выборки.
Метрики и сравнение эффективности
Ключевой инсайт исследования — эффективность простой маршрутизации превосходит использование отдельных базовых моделей. Выбор кандидатов происходит на бэк-тесте, что позволяет отбраковывать неудачные кандидаты с минимальными затратами (несколько мегабайт памяти и минут GPU-времени). Ниже приведено сравнение результатов:
| Конфигурация | Средний ранг MASE | Примечание |
|---|---|---|
| Лучшая базовая модель (одиночная) | 33.8 | Базовый уровень без маршрутизации |
| Турнир (на каждой конфигурации) | 38.0 | Выбор между базовыми моделями |
| TW3Cast (полная маршрутизация) | 19.4 | Использование специализированных LoRA-моделей |
Защита от переобучения и воспроизводимость
Авторы внедрили три механизма защиты от смещения данных: двойной критерий точности и калибровки, асимметричный отступ для кандидатов, видевших данные во время обучения, и консервативные пороги для каждого окна. Все правила выбора были протестированы во временном мета-бэк-тесте. Исследователи опубликовали таблицу маршрутизации, индексы экспертов, фиксированные версии базовых моделей и скрипт для полной регенерации результатов, обеспечивая полную прозрачность метода.
Источник: arXiv cs.AI ↗
