Проблема эпизодических бенчмарков
Большинство современных RL-бенчмарков (например, Atari или MuJoCo) предполагают сброс среды после каждого эпизода. В реальных enterprise-задачах это не так: решения накапливаются, а среда меняется. MORPHEUS базируется на «Гипотезе Большого Мира» (Big World Hypothesis, Javed & Sutton, 2024), утверждающей, что сложность мира превышает репрезентативные возможности агента, делая среду нестационарной даже при фиксированных динамических правилах.
Платформа требует от агентов трех свойств: персистентность (прошлые решения влияют на будущее), нестационарность (любая фиксированная политика со временем становится субоптимальной) и операционная сложность (отсутствие единой оптимальной стратегии).
Архитектура и механизмы сдвигов
Каждая среда — это плагин на TypeScript, экспортирующий Операционные Дескрипторы (OD). Нестационарность обеспечивается двумя движками:
- Failure Injection Engine: Внедряет 11 типов сбоев (например,
missing_data,rate_limit) с четырьмя уровнями интенсивности: легким (5%), реалистичным (8%), умеренным (15%) и агрессивным (30%). - Asynchronous Configuration Shift Controller: Изменяет параметры сбоев и спроса по фиксированным временным меткам, независимо от цикла обучения. Это предотвращает использование агентами периодичности градиентов как «часов» для предсказания сдвигов.
Метрика вознаграждения и инициализация
Вознаграждение формируется из трех верификаторов: сигналов сбоев, финансового реестра и пропускной способности ресурсов. Композитная функция использует веса по умолчанию: w_f = 0.5 (сбои), w_l = 0.25 (финансы), w_p = 0.25 (ресурсы). Теоретический максимум вознаграждения за конфигурацию составляет 0.50.
Поскольку пространство действий велико, обучение с нуля неэффективно. Используется двухэтапный пайплайн:
- Сбор траекторий моделью Gemini 3.1 Pro через фреймворк ReAct.
- Дообучение модели Qwen3-14B методом SFT (Supervised Fine-Tuning).
Все базовые алгоритмы (PPO, HER, EWC, LCM) стартуют с этого общего чекпоинта SFT.
Результаты сравнения алгоритмов
Исследователи протестировали четыре семейства алгоритмов на двух задачах: динамическое распределение ресурсов (Task 1) и планирование с задержкой эффектов (Task 2). Ни один алгоритм не доминирует во всех метриках. Ниже приведены ключевые результаты:
| Семейство алгоритмов | Механизм | Task 1 (Outbound) | Task 2 (Outbound) | Task 2 (Inbound) |
|---|---|---|---|---|
| PPO | Без механизма CL | Базовый уровень (провал) | Адаптируется только в начале | Базовый уровень |
| HER | Hindsight replay | Среднее вознаграждение | Лучшее вознаграждение | Лучшее вознаграждение, топ ранг |
| EWC | Weight consolidation | Лучшее вознаграждение | Лучшая скорость адаптации | Слабое вознаграждение |
| LCM | Latent context model | Самая быстрая адаптация | Нет преимущества | Лучшая адаптация |
Важное наблюдение: PPO и HER адаптируются только в первой конфигурации, затем перестают реагировать на изменения. Средний разрыв между результатами и теоретическим максимумом составляет около 1.0, что указывает на существенный дефицит settled-state (устоявшегося состояния) у всех методов.
Значение для индустрии
MORPHEUS закрывает критический пробел между лабораторными RL-экспериментами и промышленным Agentic AI. Для инженеров это тест на обнаружение сдвигов режимов без явных меток. Для дата-сайентистов — проверка способности к отсроченному присвоению кредита (delayed credit assignment), например, при оценке доставки OTIF. Платформа открыта на GitHub (Skyfall-Research/morpheus-evals), но пока оценивает только 2 из 5 доступных сред.
Источник: MarkTechPost ↗
