Исследования3 июля 2026 г., 14:17 МСК🤖 Auto

PMD: Как LLM учатся на ошибках через процедурную память

Исследователи представили PMD — метод, позволяющий языковым моделям сохранять и использовать опыт прошлых попыток для самосовершенствования без внешней памяти.

Баннер новости 2846

Проблема: потеря контекста в RLVR

Современные методы обучения с подкреплением на основе проверяемых наград (RLVR), включая такие варианты, как SDPO, обновляют политику модели на основе сигналов уровня эпизода. Однако при этом теряется богатая процедурная информация, содержащаяся в траекториях. Модель каждый раз заново сталкивается с похожими задачами, но не запоминает, какие стратегии работают стабильно, а какие паттерны ошибок повторяются. Это приводит к неэффективному использованию вычислительных ресурсов и медленному прогрессу.

Решение: Procedural Memory Distillation (PMD)

Авторы предлагают метод PMD, который преобразует кросс-эпизодные сигналы в переиспользуемую «процедурную память». Эта память извлекается онлайн из собственных траекторий модели и организована на трех уровнях абстракции:

  • Сырые траектории: полные истории действий модели.
  • Стратегии и уроки: самоанализ успешных и неудачных шагов.
  • Поведенческие паттерны: высокоуровневые закономерности, повторяющиеся across разных задач.

Ключевой принцип — со-эволюция (co-evolution): политика генерирует траектории, которые обновляют память, а память формирует надзор (supervision) для обновления политики. В результате на этапе инференса модель остается «безпамятной» (memory-free), так как знания уже встроены в веса.

Результаты: значительный прирост точности

Эксперименты проводились на моделях Qwen3-8B и OLMo3-Instruct-7B. PMD демонстрирует стабильное превосходство над базовым методом SDPO, особенно в задачах, требующих сложных рассуждений и программирования.

Метрика Qwen3-8B (прирост) OLMo3-Instruct-7B (прирост)
SCIKNOWEVAL +3.8% - 5.5% +3.8% - 5.5%
LIVECODEBENCH +7.9% - 13.6% +7.9% - 13.6%

Почему это важно: эффект со-эволюции

Исследование подчеркивает критическую важность взаимодействия между памятью и политикой. Блокировка (заморозка) либо памяти, либо политики приводит к падению производительности более чем на 10% на доменах SCIKNOWEVAL. Это доказывает, что именно динамическое обновление обоих компонентов позволяет модели эффективно интернализировать процедурные знания, превращая опыт из временного состояния в устойчивые параметры модели.

Источник: arXiv cs.AI ↗