Исследования30 сентября 2026 г., 09:18 МСК🤖 Auto

Кэширование памяти в RL: почему история — это груз, а не актив

Исследование Cambridge и Models2 AI провело первый причинно-следственный аудит самообученного алгоритма Disco103, выявив, что фиксация состояний памяти (рекуррентности) критически ограничивает адаптацию к изменениям среды.

Баннер новости 8576

Черный ящик самообучения вскрыт

В погоне за рекурсивным самосовершенствованием (RSI) индустрия фокусируется на масштабировании языковых моделей, но фундаментальный вопрос оптимизации остается без ответа. Алгоритм Disco103, обнаруженный методом самообнаружения, превзошел PPO, достигнув SOTA-результатов, но его внутренняя механика оставалась загадкой. Исследователь Хаоминь Ло (University of Cambridge, Models2 AI) представил первый причинно-следственный аудит (causal mechanistic audit) этого правила RL, разобрав его на пять столпов «Эры опыта» (Era of Experience): расширенный горизонт, заземленные награды, непрерывные потоки, изменения внутри жизни и глубину исследования.

Эксперимент: заморозка и пересадка памяти

Авторы провели серию хирургических манипуляций с архитектурой Disco103, фиксируя, замораживая и пересаживая рекуррентные состояния при неизменных мета-параметрах. Цель — понять, когда история обучения становится активом, а когда — балластом. Ключевые выводы:

  • Масштабирование наград: Рекуррентная история активно расширяет используемый диапазон наград, обеспечивая окно в 6 десятилетий (в условных единицах среды), в то время как нулевая фиксация ограничивает это окно тремя десятилетиями.
  • Проблема «зажимания» (Clamping): Отделение исторического контента от процесса его обслуживания показало, что штраф за несовпадение истории возникает из-за постоянного «зажимания» состояний. Если позволить импортированному состоянию эволюционировать естественно, этот груз снижается.
  • Иллюзия адаптации: В меняющейся среде контроль за удержанием данных в буфере воспроизведения (replay) перевернул преимущество над DQN. Оказалось, что внешняя ротация данных может маскировать внутреннюю пластичность модели.

Сравнительный анализ эффективности

Результаты аудита демонстрируют, что слепое копирование состояний памяти из прошлого опыта может быть контрпродуктивным без механизмов их естественной эволюции. Ниже приведено сравнение поведения алгоритма в зависимости от обработки истории:

Режим обработки истории Эффект на горизонт наград Влияние на адаптацию
Zero-pinning (без фиксации) 3 десятилетия Высокая пластичность, но риск потери контекста
Full Recurrent History (полная фиксация) 6 десятилетий Риск «зажимания» (clamping) при смене среды
Transplant with Evolution (пересадка с эволюцией) Сохраняет масштаб Снижает штраф за несовпадение, улучшает адаптацию

Значение для индустрии

Работа, валидированная через пороги возможностей и перенесенная на второе правило (OPEN), устанавливает новый стандарт аудита для самоэволюционирующих алгоритмов RL. Она доказывает, что для достижения общего интеллекта (AGI) недостаточно просто накапливать опыт — архитектура должна уметь динамически пересматривать, как она хранит и использует эту историю, избегая статического «зажимания» состояний.

Источник: arXiv cs.AI ↗