Представьте себе складской комплекс или логистический хаб. В отличие от классических задач искусственного интеллекта, где мир «перезагружается» после каждого эпизода, реальные бизнес-процессы никогда не останавливаются. Решения, принятые сегодня, влияют на завтрашний день, создавая цепную реакцию последствий. Именно этот разрыв между академическими бенчмарками и реальной жизнью пытается преодолеть Skyfall AI, представив MORPHEUS — платформу для непрерывного обучения с подкреплением (Continual Reinforcement Learning, CRL) в условиях структурированной нестационарности.
В традиционных подходах к обучению с подкреплением (RL) агент часто сталкивается с миром, который ведет себя как замкнутая система: выполнил действие — получил награду — мир сбросился. Но в enterprise-среде, где работают агенты ИИ, такого сброса не происходит. Ошибки накапливаются, ресурсы истощаются, а внешние условия меняются непредсказуемо. MORPHEUS создан, чтобы симулировать именно эту «неудобную» реальность, заставляя алгоритмы учиться на лету, без возможности откатиться к началу.
В этой статье мы подробно разберем архитектуру MORPHEUS, принципы работы его движков нестационарности, систему метрик и результаты тестирования различных алгоритмов. Мы покажем, почему стандартный PPO (Proximal Policy Optimization) часто терпит крах в таких условиях и какие альтернативы показывают лучшие результаты.
01Фундаментальная проблема: Гипотеза Большого Мира
Концепция MORPHEUS глубоко укоренена в так называемой «Гипотезе Большого Мира» (Big World Hypothesis), сформулированной Джаведом и Саттоном в 2024 году. Суть гипотезы проста, но фундаментальна: сложность реального мира превышает любую репрезентативную способность любого агента. Даже если динамика мира фиксирована и детерминирована, для агента она будет казаться нестационарной, потому что он просто не может полностью ее моделировать.
Чтобы создать среду, которая действительно требует непрерывного обучения, MORPHEUS внедряет три обязательных свойства:
- Персистентность (Persistence): Прошлые решения агента накапливаются и напрямую влияют на будущую динамику среды. Нет «чистого листа» после каждого шага.
- Нестационарность (Non-stationarity): Любая фиксированная политика (policy) со временем становится субоптимальной. То, что работало вчера, может провалиться сегодня из-за изменений в среде.
- Операционная сложность (Operational Complexity): Не существует единой оптимальной политики, которая работала бы всегда. Агент должен постоянно адаптироваться.
Каждая симуляция в MORPHEUS представляет собой автономный плагин на TypeScript. Этот плагин экспортирует так называемые Операционные Дескрипторы (Operational Descriptors, ODs). OD — это пошаговый план выполнения определенной способности или задачи. Агент взаимодействует с миром через API способностей, и каждый вызов запускает выполнение соответствующего OD. Это обеспечивает модульность и возможность легко добавлять новые сценарии.

02Как работает платформа: Движки нестационарности
Ключевая инновация MORPHEUS заключается в том, как именно создается нестационарность. Это не просто случайный шум, а два сложных движка, которые имитируют реальные сбои и изменения конфигурации.
1. Движок инъекции сбоев (Failure Injection Engine)
Этот движок вставляет типизированные нарушения между шагами выполнения Операционных Дескрипторов. Система использует одиннадцать различных типов сбоев, среди которых:
missing_data(отсутствие данных)dependency_failure(сбой зависимостей)rate_limit(ограничение скорости запросов)
Сбои внедряются с четырьмя предустановленными уровнями интенсивности, что позволяет тестировать устойчивость агентов в разных условиях:
- Легкий (Light): 5% вероятность сбоя.
- Реалистичный (Realistic): 8% вероятность сбоя.
- Умеренный (Moderate): 15% вероятность сбоя.
- Агрессивный (Aggressive): 30% вероятность сбоя.

Это позволяет исследователям проверять, как агент справляется с постепенным ухудшением условий, что критически важно для промышленных систем, где сбои — это норма, а не исключение.
2. Контроллер асинхронного сдвига конфигурации
Второй движок отвечает за более глобальные изменения. Он изменяет предустановки сбоев и уровень спроса в фиксированные моменты времени. Важнейшая деталь: эти сдвиги происходят асинхронно по отношению к циклу обучения. Они не синхронизированы с обновлениями градиентов.
Зачем это нужно? Если бы сдвиги совпадали с шагами обучения, агент мог бы неосознанно использовать периодичность обновлений как «прокси-часы», просто запоминая, когда ждать изменений. Асинхронность заставляет агент полагаться исключительно на наблюдаемые изменения в среде, а не на внутреннюю структуру алгоритма.
03Система вознаграждения: Операционные верификаторы
В традиционных RL-задачах награда часто является простой функцией от состояния (например, +1 за победу, -1 за поражение). В MORPHEUS награда формируется из трех операционных верификаторов, которые логируются платформой нативно. Это делает систему вознаграждения максимально близкой к реальным бизнес-показателям.
Три компонента вознаграждения:
- Сигналы событий сбоев (Failure event signals): Отражают количество и тяжесть произошедших сбоев.
- Статус финансового реестра (Financial ledger status): Отражает соответствие фактических затрат плановым.
- Пропускная способность ресурсов (Resource throughput): Отражает эффективность использования ресурсов (например, выполнение заказов).
Композитная награда вычисляется по следующей формуле (по умолчанию веса распределены так: w_f = 0.5, w_l = 0.25, w_p = 0.25):
# Композитная награда — MORPHEUS, Приложение C (веса по умолчанию)
def clip(lo, hi, value):
return max(lo, min(hi, value))
def composite_reward(tickets, actual_cost, planned_cost, units, capacity):
w_f = 0.5
w_l = 0.25
w_p = 0.25
# Сигнал событий сбоев
r_f = sum("severity" for t in tickets)
# Финансовый реестр
r_l = clip(actual_cost, planned_cost)
# Пропускная способность ресурсов
r_p = clip(units, capacity)
return w_f * r_f + w_l * r_l + w_p * r_pПри идеальных условиях (ноль сбоев, минимальные затраты, полная пропускная способность) верхняя граница награды для каждой конфигурации составляет 0.50. Это важный ориентир для оценки эффективности агентов.
04Инициализация политик: От ReAct к SFT
Проблема чистого обучения с подкреплением «с нуля» (from scratch) в MORPHEUS заключается в огромном пространстве действий. Обучать агента с нуля в такой сложной, нестационарной среде практически невозможно — он будет тратить слишком много времени на исследование и часто терпеть крах.
Поэтому MORPHEUS использует двухэтапный пайплайн инициализации:

- Сбор траекторий: Передовая модель (на момент публикации использовался Gemini 3.1 Pro) собирает траектории, используя фреймворк ReAct (Reasoning + Acting). Это позволяет получить качественные примеры поведения в среде.
- Супервизорное дообучение (SFT): Эти траектории используются для дообучения модели Qwen3-14B методом SFT.
Таким образом, все запуски RL начинаются с общего чекпоинта SFT. Это изолирует поведение непрерывного обучения от базовой операционной компетентности. Все базовые алгоритмы (baselines) используют PPO в качестве оптимизатора для онлайн-дообучения после SFT.
05Шесть метрик оценки
Накопленная награда (cumulative reward) сама по себе недостаточна для оценки работы в нестационарной среде. Скалярная сумма скрывает важные аспекты поведения агента на протяжении всего горизонта обучения. Поэтому команда исследователей предложила протокол из шести метрик:
- Награда на конфигурацию (Per-configuration reward): Насколько хорошо агент работает в каждой конкретной фазе.
- Скорость адаптации (Adaptation speed): Главная метрика. Измеряет количество шагов, необходимых для того, чтобы среднее значение награды достигло половины от верхней границы.
- Забытость (Forgetting): Насколько сильно агент теряет навыки, полученные в предыдущих конфигурациях, после смены среды.
- Время восстановления (Recovery time): Сколько времени нужно агенту, чтобы вернуться к стабильной производительности после сбоя или сдвига.
- Стабильность (Stability): Отсутствие резких колебаний в производительности.
- Разрыв производительности (Performance gap): Разница между текущей производительностью агента и теоретическим максимумом.
Дополнительно используются диагностические метрики: относительное преимущество адаптации (RAA) и пластичность через эффективный ранг (effective rank).
06Результаты тестирования базовых алгоритмов
Исследователи протестировали четыре семейства алгоритмов, начиная с общего чекпоинта SFT. Были определены две основные задачи:
- Задача 1: Динамическое распределение ресурсов при структурированном дрейфе (process-outbound).
- Задача 2: Планирование при дрейфе с задержанными эффектами (process-inbound).
Результаты показали, что ни один алгоритм не является универсальным лидером. Вот сводная таблица результатов:
| Семейство | Механизм | Исходящая Задача 1 | Исходящая Задача 2 | Входящая Задача 2 |
|---|---|---|---|---|
| PPO | Нет механизма CL | Базовый уровень (провал) | Адаптируется только в начале | Базовая награда |
| HER | Отложенная replay (Hindsight) | Средняя награда | Лучшая награда | Лучшая награда, топ ранг |
| EWC | Консолидация весов | Лучшая награда | Лучшая адаптация | Слабая награда |
| LCM | Модель латентного контекста | Самая быстрая адаптация | Нет преимущества | Лучшая адаптация |
Ключевые выводы из результатов:
- PPO и HER: В целом адаптируются только в первой конфигурации. Затем они перестают адаптироваться в последующих режимах, даже без явных сигналов об изменениях. Это показывает слабость стандартного PPO в условиях непрерывных изменений.
- EWC (Elastic Weight Consolidation): Показал лучшую награду в Задаче 1 и лучшую скорость адаптации в Задаче 2. Механизм консолидации весов помогает сохранять важные навыки.
- LCM (Latent Context Model): Демонстрирует самую быструю адаптацию в Задаче 1, но теряет свое преимущество в Задаче 2, где есть задержанные награды. В Входящей Задаче 2 LCM показывает лучшую адаптацию.
- Разрыв производительности: Средний разрыв производительности для всех методов составляет около 1.0. Это сигнализирует о большом дефиците в установившемся состоянии, а не о незначительной проблеме настройки гиперпараметров.

07Практическое применение и примеры использования
MORPHEUS полезен для разных ролей в индустрии ИИ. Вот как платформа может быть использована на практике:
Для AI-инженеров
Платформа позволяет тестировать, способен ли агент обнаруживать сдвиги режимов (regime shifts) без явных меток. Например, спрос может переключиться с низкого на взрывной (bursty), и политика должна адаптироваться без какого-либо внешнего сигнала. MORPHEUS дает возможность измерить эту способность количественно.
Для Data Scientists
Платформа испытывает на прочность механизмы отложенного присвоения кредита (delayed credit assignment). Классический пример: доставка «On-Time In-Full» (OTIF) становится наблюдаемой только через несколько дней после решения о диспетчеризации. Агент должен понять, какое именно решение привело к успешной доставке, даже если результат виден далеко в будущем.
Для Software Engineers
Формат плагинов на TypeScript позволяет инженерам легко заменять функции вознаграждения или переключать наблюдаемость (observability) без изменения самой динамики среды. Это упрощает интеграцию MORPHEUS в существующие CI/CD пайплайны и системы тестирования.
Skyfall-Research/morpheus-evals. Это позволяет любому исследователю воспроизвести результаты и добавить свои алгоритмы в сравнение.08Сильные и слабые стороны платформы
Как и любая новая технология, MORPHEUS имеет свои преимущества и ограничения, которые важно учитывать при использовании.
Сильные стороны
- Персистентные миры без сброса: Полное соответствие реальным развернутым enterprise-системам, где нет «перезагрузки».
- Параметризуемые сдвиги режимов: Возможность воспроизводимого тестирования для честного сравнения различных алгоритмов.
- Нативные операционные верификаторы: Награда формируется из реальных операционных данных, не требуя внешней аннотации или ручного создания наград.
- Открытый код: Доступность кода оценки способствует прозрачности и развитию сообщества.
Слабые стороны
- Ограниченное количество сред: На данный момент оценено только 2 из 5 запланированных сред.
- Оптимистичная верхняя граница: Теоретический максимум предполагает отсутствие сбоев, что в реальности недостижимо, поэтому оценка может быть завышена.
- Внешние триггеры сдвигов: Сдвиги инициируются извне, а не вызываются накоплением решений агента (хотя это и соответствует некоторым сценариям, это не полностью отражает замкнутые циклы обратной связи).
- Веса награды: Веса являются исследовательскими переменными, а не валидированными отраслевыми целями. В реальной компании приоритеты могут быть другими.
09Что это значит на практике
Появление MORPHEUS от Skyfall AI знаменует собой сдвиг парадигмы в области обучения с подкреплением. Мы переходим от эпохи «игрушечных» сред, где агент может бесконечно перезапускать эпизоды, к эпохе «серьезных» симуляций, где ошибки имеют долгосрочные последствия, а среда постоянно меняется.
Для компаний, внедряющих Agentic AI в логистику, управление запасами или динамическое ценообразование, MORPHEUS предлагает инструмент для проверки устойчивости их решений. Если ваш агент не может адаптироваться к сдвигу спроса или сбою в поставках в симуляции MORPHEUS, он, скорее всего, потерпит неудачу в продакшене.
Отсутствие единого «победителя» среди алгоритмов (PPO, HER, EWC, LCM) говорит о том, что будущее RL — это не поиск одного универсального алгоритма, а создание гибридных систем, которые комбинируют сильные стороны разных подходов: консолидацию знаний (EWC), работу с отложенными наградами (HER) и быструю адаптацию к контексту (LCM).
Мораль проста: в мире, который никогда не сбрасывается, способность учиться непрерывно становится главным конкурентным преимуществом. MORPHEUS дает нам стандарт, по которому можно измерять эту способность.
Для тех, кто хочет углубиться в технические детали, рекомендуется ознакомиться с оригинальной статьей и страницей проекта. Также следите за обновлениями в сообществе ML, так как эта платформа может стать новым стандартом де-факто для тестирования непрерывного обучения.
Источник: MarkTechPost ↗
