Исследования20 августа 2026 г., 03:18 МСК🤖 Auto

LiveHouse-TS: Почему статические бенчмарки для TSFM больше не работают

Исследователи представили LiveHouse-TS — первый «живой» бенчмарк для временных рядов, доказывающий, что лидерство моделей в статических тестах не гарантирует их устойчивости в реальном мире.

Баннер новости 6121

Конец эпохи «снимков» в оценке TSFM

Фундаментальные модели временных рядов (Time Series Foundation Models, TSFMs) позиционируются как универсальные решения для прогнозирования без дообучения (zero-shot). Однако существующие протоколы оценки опираются на статические наборы данных с фиксированными историческими окнами. Такой подход дает лишь моментальный снимок (snapshot) производительности, игнорируя ключевые факторы реальной эксплуатации: сезонные колебания, сдвиги распределений (distribution shifts) и непредвиденные события.

Команда исследователей во главе с Хаоминем Вэном (Haomin Wen) и Цзыю Чжоу (Ziyu Zhou) из Университета Цинхуа представила LiveHouse-TS — первую инфраструктуру «живого» бенчмарка (living benchmark) для TSFM. В отличие от традиционных лидербордов, LiveHouse-TS оценивает модели преquentialно (prequentially), то есть на реальных будущих данных в условиях открытого мира, смещая фокус с разовой точности на непрерывную временную валидность.

Масштаб и архитектура LiveHouse-TS

Инфраструктура разработана для ответа на долгосрочные научные вопросы: сохраняют ли модели свои позиции в рейтингах со временем и какие из них действительно устойчивы к изменениям среды. Для этого были задействованы данные из 11 различных доменов и 17 наборов данных, охватывающих широкий спектр прикладных задач.

Ключевая особенность LiveHouse-TS — переход от статического тестирования к потоковой оценке. Это позволяет выявлять деградацию моделей, которая часто остается незамеченной при использовании фиксированных тестовых выборок.

Результаты: переделка лидерборда

Масштабные потоковые оценки показали драматические изменения в позициях моделей. То, что считалось «лучшим» в статических условиях, часто теряло лидерство при столкновении с реальными временными сдвигами. Ниже приведена сравнительная динамика, иллюстрирующая разницу между статической и «живой» оценкой:

Параметр оценки Статический бенчмарк (Snapshot) LiveHouse-TS (Living Benchmark)
Метрика Средняя точность на фиксированном историческом окне Непрерывная временная валидность (prequential accuracy)
Учет среды Игнорирует сезонность и сдвиги распределений Учитывает эволюцию данных и непредвиденные события
Результат рейтинга Стабильный, но потенциально обманчивый Драматическое перераспределение позиций (reshuffling)
Объем данных Фиксированный подмножество 11 доменов, 17 наборов данных в реальном времени

Почему это важно для индустрии

Внедрение LiveHouse-TS сигнализирует о необходимости пересмотра стандартов в области анализа временных рядов. Для разработчиков и исследователей это означает, что высокая точность на публичных датасетах больше не является гарантией успешного внедрения в продакшен. Инфраструктура открывает путь к созданию более надежных фундаментальных моделей, способных адаптироваться к изменяющимся условиям, что критически важно для финансов, энергетики и логистики.

Источник: arXiv cs.AI ↗