Главная/Блог/Гайд/MORPHEUS от Skyfall AI: Эволюция…
Гайд10 мин чтения · 14 июля 2026 г.

MORPHEUS от Skyfall AI: Эволюция RL-бенчмарков для непрерывного обучения

Skyfall AI представили MORPHEUS — первую платформу для непрерывного обучения с подкреплением в условиях неизменяемой среды. Разбираем архитектуру, метрики и почему старые подходы больше не работают.

MORPHEUS от Skyfall AI: Эволюция RL-бенчмарков для непрерывного обучения

Представьте себе складской комплекс или логистический хаб. В отличие от классических задач искусственного интеллекта, где мир «перезагружается» после каждого эпизода, реальные бизнес-процессы никогда не останавливаются. Решения, принятые сегодня, влияют на завтрашний день, создавая цепную реакцию последствий. Именно этот разрыв между академическими бенчмарками и реальной жизнью пытается преодолеть Skyfall AI, представив MORPHEUS — платформу для непрерывного обучения с подкреплением (Continual Reinforcement Learning, CRL) в условиях структурированной нестационарности.

В традиционных подходах к обучению с подкреплением (RL) агент часто сталкивается с миром, который ведет себя как замкнутая система: выполнил действие — получил награду — мир сбросился. Но в enterprise-среде, где работают агенты ИИ, такого сброса не происходит. Ошибки накапливаются, ресурсы истощаются, а внешние условия меняются непредсказуемо. MORPHEUS создан, чтобы симулировать именно эту «неудобную» реальность, заставляя алгоритмы учиться на лету, без возможности откатиться к началу.

В этой статье мы подробно разберем архитектуру MORPHEUS, принципы работы его движков нестационарности, систему метрик и результаты тестирования различных алгоритмов. Мы покажем, почему стандартный PPO (Proximal Policy Optimization) часто терпит крах в таких условиях и какие альтернативы показывают лучшие результаты.

01Фундаментальная проблема: Гипотеза Большого Мира

Концепция MORPHEUS глубоко укоренена в так называемой «Гипотезе Большого Мира» (Big World Hypothesis), сформулированной Джаведом и Саттоном в 2024 году. Суть гипотезы проста, но фундаментальна: сложность реального мира превышает любую репрезентативную способность любого агента. Даже если динамика мира фиксирована и детерминирована, для агента она будет казаться нестационарной, потому что он просто не может полностью ее моделировать.

Чтобы создать среду, которая действительно требует непрерывного обучения, MORPHEUS внедряет три обязательных свойства:

  1. Персистентность (Persistence): Прошлые решения агента накапливаются и напрямую влияют на будущую динамику среды. Нет «чистого листа» после каждого шага.
  2. Нестационарность (Non-stationarity): Любая фиксированная политика (policy) со временем становится субоптимальной. То, что работало вчера, может провалиться сегодня из-за изменений в среде.
  3. Операционная сложность (Operational Complexity): Не существует единой оптимальной политики, которая работала бы всегда. Агент должен постоянно адаптироваться.

Каждая симуляция в MORPHEUS представляет собой автономный плагин на TypeScript. Этот плагин экспортирует так называемые Операционные Дескрипторы (Operational Descriptors, ODs). OD — это пошаговый план выполнения определенной способности или задачи. Агент взаимодействует с миром через API способностей, и каждый вызов запускает выполнение соответствующего OD. Это обеспечивает модульность и возможность легко добавлять новые сценарии.

Визуализация концепции Big World Hypothesis и сложности enterprise-среды.
Визуализация концепции Big World Hypothesis и сложности enterprise-среды.

02Как работает платформа: Движки нестационарности

Ключевая инновация MORPHEUS заключается в том, как именно создается нестационарность. Это не просто случайный шум, а два сложных движка, которые имитируют реальные сбои и изменения конфигурации.

1. Движок инъекции сбоев (Failure Injection Engine)

Этот движок вставляет типизированные нарушения между шагами выполнения Операционных Дескрипторов. Система использует одиннадцать различных типов сбоев, среди которых:

  • missing_data (отсутствие данных)
  • dependency_failure (сбой зависимостей)
  • rate_limit (ограничение скорости запросов)

Сбои внедряются с четырьмя предустановленными уровнями интенсивности, что позволяет тестировать устойчивость агентов в разных условиях:

  • Легкий (Light): 5% вероятность сбоя.
  • Реалистичный (Realistic): 8% вероятность сбоя.
  • Умеренный (Moderate): 15% вероятность сбоя.
  • Агрессивный (Aggressive): 30% вероятность сбоя.
MORPHEUS от Skyfall AI: Эволюция RL-бенчмарков для непрерывного обучения

Это позволяет исследователям проверять, как агент справляется с постепенным ухудшением условий, что критически важно для промышленных систем, где сбои — это норма, а не исключение.

2. Контроллер асинхронного сдвига конфигурации

Второй движок отвечает за более глобальные изменения. Он изменяет предустановки сбоев и уровень спроса в фиксированные моменты времени. Важнейшая деталь: эти сдвиги происходят асинхронно по отношению к циклу обучения. Они не синхронизированы с обновлениями градиентов.

Зачем это нужно? Если бы сдвиги совпадали с шагами обучения, агент мог бы неосознанно использовать периодичность обновлений как «прокси-часы», просто запоминая, когда ждать изменений. Асинхронность заставляет агент полагаться исключительно на наблюдаемые изменения в среде, а не на внутреннюю структуру алгоритма.

03Система вознаграждения: Операционные верификаторы

В традиционных RL-задачах награда часто является простой функцией от состояния (например, +1 за победу, -1 за поражение). В MORPHEUS награда формируется из трех операционных верификаторов, которые логируются платформой нативно. Это делает систему вознаграждения максимально близкой к реальным бизнес-показателям.

Три компонента вознаграждения:

  1. Сигналы событий сбоев (Failure event signals): Отражают количество и тяжесть произошедших сбоев.
  2. Статус финансового реестра (Financial ledger status): Отражает соответствие фактических затрат плановым.
  3. Пропускная способность ресурсов (Resource throughput): Отражает эффективность использования ресурсов (например, выполнение заказов).

Композитная награда вычисляется по следующей формуле (по умолчанию веса распределены так: w_f = 0.5, w_l = 0.25, w_p = 0.25):

terminalpython
# Композитная награда — MORPHEUS, Приложение C (веса по умолчанию)
def clip(lo, hi, value):
    return max(lo, min(hi, value))

def composite_reward(tickets, actual_cost, planned_cost, units, capacity):
    w_f = 0.5
    w_l = 0.25
    w_p = 0.25
    
    # Сигнал событий сбоев
    r_f = sum("severity" for t in tickets)
    
    # Финансовый реестр
    r_l = clip(actual_cost, planned_cost)
    
    # Пропускная способность ресурсов
    r_p = clip(units, capacity)
    
    return w_f * r_f + w_l * r_l + w_p * r_p

При идеальных условиях (ноль сбоев, минимальные затраты, полная пропускная способность) верхняя граница награды для каждой конфигурации составляет 0.50. Это важный ориентир для оценки эффективности агентов.

💡
Важно понимать. Использование композитной награды означает, что агент не может оптимизировать только один показатель. Попытка максимизировать пропускную способность может привести к росту затрат, а экономия на ресурсах — к увеличению числа сбоев. Агент должен находить баланс, что делает задачу многомерной и сложной.

04Инициализация политик: От ReAct к SFT

Проблема чистого обучения с подкреплением «с нуля» (from scratch) в MORPHEUS заключается в огромном пространстве действий. Обучать агента с нуля в такой сложной, нестационарной среде практически невозможно — он будет тратить слишком много времени на исследование и часто терпеть крах.

Поэтому MORPHEUS использует двухэтапный пайплайн инициализации:

MORPHEUS от Skyfall AI: Эволюция RL-бенчмарков для непрерывного обучения
  1. Сбор траекторий: Передовая модель (на момент публикации использовался Gemini 3.1 Pro) собирает траектории, используя фреймворк ReAct (Reasoning + Acting). Это позволяет получить качественные примеры поведения в среде.
  2. Супервизорное дообучение (SFT): Эти траектории используются для дообучения модели Qwen3-14B методом SFT.

Таким образом, все запуски RL начинаются с общего чекпоинта SFT. Это изолирует поведение непрерывного обучения от базовой операционной компетентности. Все базовые алгоритмы (baselines) используют PPO в качестве оптимизатора для онлайн-дообучения после SFT.

05Шесть метрик оценки

Накопленная награда (cumulative reward) сама по себе недостаточна для оценки работы в нестационарной среде. Скалярная сумма скрывает важные аспекты поведения агента на протяжении всего горизонта обучения. Поэтому команда исследователей предложила протокол из шести метрик:

  1. Награда на конфигурацию (Per-configuration reward): Насколько хорошо агент работает в каждой конкретной фазе.
  2. Скорость адаптации (Adaptation speed): Главная метрика. Измеряет количество шагов, необходимых для того, чтобы среднее значение награды достигло половины от верхней границы.
  3. Забытость (Forgetting): Насколько сильно агент теряет навыки, полученные в предыдущих конфигурациях, после смены среды.
  4. Время восстановления (Recovery time): Сколько времени нужно агенту, чтобы вернуться к стабильной производительности после сбоя или сдвига.
  5. Стабильность (Stability): Отсутствие резких колебаний в производительности.
  6. Разрыв производительности (Performance gap): Разница между текущей производительностью агента и теоретическим максимумом.

Дополнительно используются диагностические метрики: относительное преимущество адаптации (RAA) и пластичность через эффективный ранг (effective rank).

⚠️
Критический момент. В условиях нестационарности скорость адаптации часто важнее абсолютной максимальной награды. Агент, который быстро адаптируется к новым условиям, может быть полезнее, чем агент с высокой, но «застывшей» максимальной наградой, которая не учитывает изменения среды.

06Результаты тестирования базовых алгоритмов

Исследователи протестировали четыре семейства алгоритмов, начиная с общего чекпоинта SFT. Были определены две основные задачи:

  • Задача 1: Динамическое распределение ресурсов при структурированном дрейфе (process-outbound).
  • Задача 2: Планирование при дрейфе с задержанными эффектами (process-inbound).

Результаты показали, что ни один алгоритм не является универсальным лидером. Вот сводная таблица результатов:

Семейство Механизм Исходящая Задача 1 Исходящая Задача 2 Входящая Задача 2
PPO Нет механизма CL Базовый уровень (провал) Адаптируется только в начале Базовая награда
HER Отложенная replay (Hindsight) Средняя награда Лучшая награда Лучшая награда, топ ранг
EWC Консолидация весов Лучшая награда Лучшая адаптация Слабая награда
LCM Модель латентного контекста Самая быстрая адаптация Нет преимущества Лучшая адаптация

Ключевые выводы из результатов:

  • PPO и HER: В целом адаптируются только в первой конфигурации. Затем они перестают адаптироваться в последующих режимах, даже без явных сигналов об изменениях. Это показывает слабость стандартного PPO в условиях непрерывных изменений.
  • EWC (Elastic Weight Consolidation): Показал лучшую награду в Задаче 1 и лучшую скорость адаптации в Задаче 2. Механизм консолидации весов помогает сохранять важные навыки.
  • LCM (Latent Context Model): Демонстрирует самую быструю адаптацию в Задаче 1, но теряет свое преимущество в Задаче 2, где есть задержанные награды. В Входящей Задаче 2 LCM показывает лучшую адаптацию.
  • Разрыв производительности: Средний разрыв производительности для всех методов составляет около 1.0. Это сигнализирует о большом дефиците в установившемся состоянии, а не о незначительной проблеме настройки гиперпараметров.
MORPHEUS от Skyfall AI: Эволюция RL-бенчмарков для непрерывного обучения

07Практическое применение и примеры использования

MORPHEUS полезен для разных ролей в индустрии ИИ. Вот как платформа может быть использована на практике:

Для AI-инженеров

Платформа позволяет тестировать, способен ли агент обнаруживать сдвиги режимов (regime shifts) без явных меток. Например, спрос может переключиться с низкого на взрывной (bursty), и политика должна адаптироваться без какого-либо внешнего сигнала. MORPHEUS дает возможность измерить эту способность количественно.

Для Data Scientists

Платформа испытывает на прочность механизмы отложенного присвоения кредита (delayed credit assignment). Классический пример: доставка «On-Time In-Full» (OTIF) становится наблюдаемой только через несколько дней после решения о диспетчеризации. Агент должен понять, какое именно решение привело к успешной доставке, даже если результат виден далеко в будущем.

Для Software Engineers

Формат плагинов на TypeScript позволяет инженерам легко заменять функции вознаграждения или переключать наблюдаемость (observability) без изменения самой динамики среды. Это упрощает интеграцию MORPHEUS в существующие CI/CD пайплайны и системы тестирования.

📌
Факт. Код оценки (evaluation code) для MORPHEUS открыт и доступен на GitHub под репозиторием Skyfall-Research/morpheus-evals. Это позволяет любому исследователю воспроизвести результаты и добавить свои алгоритмы в сравнение.

08Сильные и слабые стороны платформы

Как и любая новая технология, MORPHEUS имеет свои преимущества и ограничения, которые важно учитывать при использовании.

Сильные стороны

  • Персистентные миры без сброса: Полное соответствие реальным развернутым enterprise-системам, где нет «перезагрузки».
  • Параметризуемые сдвиги режимов: Возможность воспроизводимого тестирования для честного сравнения различных алгоритмов.
  • Нативные операционные верификаторы: Награда формируется из реальных операционных данных, не требуя внешней аннотации или ручного создания наград.
  • Открытый код: Доступность кода оценки способствует прозрачности и развитию сообщества.

Слабые стороны

  • Ограниченное количество сред: На данный момент оценено только 2 из 5 запланированных сред.
  • Оптимистичная верхняя граница: Теоретический максимум предполагает отсутствие сбоев, что в реальности недостижимо, поэтому оценка может быть завышена.
  • Внешние триггеры сдвигов: Сдвиги инициируются извне, а не вызываются накоплением решений агента (хотя это и соответствует некоторым сценариям, это не полностью отражает замкнутые циклы обратной связи).
  • Веса награды: Веса являются исследовательскими переменными, а не валидированными отраслевыми целями. В реальной компании приоритеты могут быть другими.

09Что это значит на практике

Появление MORPHEUS от Skyfall AI знаменует собой сдвиг парадигмы в области обучения с подкреплением. Мы переходим от эпохи «игрушечных» сред, где агент может бесконечно перезапускать эпизоды, к эпохе «серьезных» симуляций, где ошибки имеют долгосрочные последствия, а среда постоянно меняется.

Для компаний, внедряющих Agentic AI в логистику, управление запасами или динамическое ценообразование, MORPHEUS предлагает инструмент для проверки устойчивости их решений. Если ваш агент не может адаптироваться к сдвигу спроса или сбою в поставках в симуляции MORPHEUS, он, скорее всего, потерпит неудачу в продакшене.

Отсутствие единого «победителя» среди алгоритмов (PPO, HER, EWC, LCM) говорит о том, что будущее RL — это не поиск одного универсального алгоритма, а создание гибридных систем, которые комбинируют сильные стороны разных подходов: консолидацию знаний (EWC), работу с отложенными наградами (HER) и быструю адаптацию к контексту (LCM).

Мораль проста: в мире, который никогда не сбрасывается, способность учиться непрерывно становится главным конкурентным преимуществом. MORPHEUS дает нам стандарт, по которому можно измерять эту способность.

Для тех, кто хочет углубиться в технические детали, рекомендуется ознакомиться с оригинальной статьей и страницей проекта. Также следите за обновлениями в сообществе ML, так как эта платформа может стать новым стандартом де-факто для тестирования непрерывного обучения.

Источник: MarkTechPost ↗