Проблема: потеря контекста в RLVR
Современные методы обучения с подкреплением на основе проверяемых наград (RLVR), включая такие варианты, как SDPO, обновляют политику модели на основе сигналов уровня эпизода. Однако при этом теряется богатая процедурная информация, содержащаяся в траекториях. Модель каждый раз заново сталкивается с похожими задачами, но не запоминает, какие стратегии работают стабильно, а какие паттерны ошибок повторяются. Это приводит к неэффективному использованию вычислительных ресурсов и медленному прогрессу.
Решение: Procedural Memory Distillation (PMD)
Авторы предлагают метод PMD, который преобразует кросс-эпизодные сигналы в переиспользуемую «процедурную память». Эта память извлекается онлайн из собственных траекторий модели и организована на трех уровнях абстракции:
- Сырые траектории: полные истории действий модели.
- Стратегии и уроки: самоанализ успешных и неудачных шагов.
- Поведенческие паттерны: высокоуровневые закономерности, повторяющиеся across разных задач.
Ключевой принцип — со-эволюция (co-evolution): политика генерирует траектории, которые обновляют память, а память формирует надзор (supervision) для обновления политики. В результате на этапе инференса модель остается «безпамятной» (memory-free), так как знания уже встроены в веса.
Результаты: значительный прирост точности
Эксперименты проводились на моделях Qwen3-8B и OLMo3-Instruct-7B. PMD демонстрирует стабильное превосходство над базовым методом SDPO, особенно в задачах, требующих сложных рассуждений и программирования.
| Метрика | Qwen3-8B (прирост) | OLMo3-Instruct-7B (прирост) |
|---|---|---|
| SCIKNOWEVAL | +3.8% - 5.5% | +3.8% - 5.5% |
| LIVECODEBENCH | +7.9% - 13.6% | +7.9% - 13.6% |
Почему это важно: эффект со-эволюции
Исследование подчеркивает критическую важность взаимодействия между памятью и политикой. Блокировка (заморозка) либо памяти, либо политики приводит к падению производительности более чем на 10% на доменах SCIKNOWEVAL. Это доказывает, что именно динамическое обновление обоих компонентов позволяет модели эффективно интернализировать процедурные знания, превращая опыт из временного состояния в устойчивые параметры модели.
Источник: arXiv cs.AI ↗
