Исследования14 июля 2026 г., 03:18 МСК🤖 Auto

Skyfall AI представил MORPHEUS: бенчмарк для непрерывного обучения в реальных условиях

Skyfall AI выпустил MORPHEUS — первую платформу для непрерывного обучения с подкреплением (CRL) в персистентных средах. В отличие от классических тестов, MORPHEUS не сбрасывает состояние мира, заставляя агентов адаптироваться к дрейфу параметров в ре

Баннер новости 3499

Проблема эпизодических бенчмарков

Большинство современных RL-бенчмарков (например, Atari или MuJoCo) предполагают сброс среды после каждого эпизода. В реальных enterprise-задачах это не так: решения накапливаются, а среда меняется. MORPHEUS базируется на «Гипотезе Большого Мира» (Big World Hypothesis, Javed & Sutton, 2024), утверждающей, что сложность мира превышает репрезентативные возможности агента, делая среду нестационарной даже при фиксированных динамических правилах.

Платформа требует от агентов трех свойств: персистентность (прошлые решения влияют на будущее), нестационарность (любая фиксированная политика со временем становится субоптимальной) и операционная сложность (отсутствие единой оптимальной стратегии).

Архитектура и механизмы сдвигов

Каждая среда — это плагин на TypeScript, экспортирующий Операционные Дескрипторы (OD). Нестационарность обеспечивается двумя движками:

  • Failure Injection Engine: Внедряет 11 типов сбоев (например, missing_data, rate_limit) с четырьмя уровнями интенсивности: легким (5%), реалистичным (8%), умеренным (15%) и агрессивным (30%).
  • Asynchronous Configuration Shift Controller: Изменяет параметры сбоев и спроса по фиксированным временным меткам, независимо от цикла обучения. Это предотвращает использование агентами периодичности градиентов как «часов» для предсказания сдвигов.

Метрика вознаграждения и инициализация

Вознаграждение формируется из трех верификаторов: сигналов сбоев, финансового реестра и пропускной способности ресурсов. Композитная функция использует веса по умолчанию: w_f = 0.5 (сбои), w_l = 0.25 (финансы), w_p = 0.25 (ресурсы). Теоретический максимум вознаграждения за конфигурацию составляет 0.50.

Поскольку пространство действий велико, обучение с нуля неэффективно. Используется двухэтапный пайплайн:

  1. Сбор траекторий моделью Gemini 3.1 Pro через фреймворк ReAct.
  2. Дообучение модели Qwen3-14B методом SFT (Supervised Fine-Tuning).

Все базовые алгоритмы (PPO, HER, EWC, LCM) стартуют с этого общего чекпоинта SFT.

Результаты сравнения алгоритмов

Исследователи протестировали четыре семейства алгоритмов на двух задачах: динамическое распределение ресурсов (Task 1) и планирование с задержкой эффектов (Task 2). Ни один алгоритм не доминирует во всех метриках. Ниже приведены ключевые результаты:

Семейство алгоритмов Механизм Task 1 (Outbound) Task 2 (Outbound) Task 2 (Inbound)
PPO Без механизма CL Базовый уровень (провал) Адаптируется только в начале Базовый уровень
HER Hindsight replay Среднее вознаграждение Лучшее вознаграждение Лучшее вознаграждение, топ ранг
EWC Weight consolidation Лучшее вознаграждение Лучшая скорость адаптации Слабое вознаграждение
LCM Latent context model Самая быстрая адаптация Нет преимущества Лучшая адаптация

Важное наблюдение: PPO и HER адаптируются только в первой конфигурации, затем перестают реагировать на изменения. Средний разрыв между результатами и теоретическим максимумом составляет около 1.0, что указывает на существенный дефицит settled-state (устоявшегося состояния) у всех методов.

Значение для индустрии

MORPHEUS закрывает критический пробел между лабораторными RL-экспериментами и промышленным Agentic AI. Для инженеров это тест на обнаружение сдвигов режимов без явных меток. Для дата-сайентистов — проверка способности к отсроченному присвоению кредита (delayed credit assignment), например, при оценке доставки OTIF. Платформа открыта на GitHub (Skyfall-Research/morpheus-evals), но пока оценивает только 2 из 5 доступных сред.

Источник: MarkTechPost ↗