Исследования18 сентября 2026 г., 07:18 МСК🤖 Auto

RETD: Прорыв в стабильности off-policy обучения с постоянным шагом

Исследователи представили Regularized Emphatic TD (RETD), метод, решающий проблему взрывной дисперсии в emphatic temporal-difference learning. Новый алгоритм обеспечивает математически доказанную сходимость даже при использовании постоянного шага обу

Баннер новости 7767

Проблема: Парадокс стабильности ETD

Emphatic Temporal-Difference (ETD) обучение известно своей способностью стабилизировать ожидаемые off-policy обновления TD и изменять геометрию проекции. Однако, как показывают новые исследования, эти свойства не гарантируют стабильности при использовании постоянного шага обучения (constant stepsize). Авторы демонстрируют эргодический контрпример с двумя состояниями, где среднее отображение ETD сжимается, но выборочное произведение имеет положительный верхний показатель Ляпунова. Это означает, что алгоритм может расходиться на практике, несмотря на теоретическую устойчивость в среднем.

Решение: Regularized Emphatic TD (RETD)

Для устранения этой проблемы предложен метод RETD. Ключевые особенности архитектуры:

  • Нормализация после шока: Вводится первый порядок пост-шоковой коррекции.
  • Сохранение структуры: Следы (traces) и коэффициенты важности (importance ratios) остаются неизменными.
  • Утечка сигнала: Сигнал emphatic TD сохраняется в скалярном состоянии с «утечкой» (leaky scalar state), а коррекция выпускается с задержкой.

Математические гарантии и результаты

RETD обеспечивает сходимость почти наверное для гармонически убывающих шагов. Для постоянного шага доказан результат сжатия моментов при условии. Эксперименты на 10 000 запусков подтверждают:

  • Восстановление фиксированной точки ETD точно (через single- и two-regularization readouts).
  • Наличие сертифицированных отрицательных показателей Ляпунова на двух состояниях и одной точке Бэйда (Baird point).
  • Существование немонотонной области стабильности, зависящей от задачи.
Характеристика ETD (стандартный) RETD (предложенный)
Стабильность при постоянном шаге Не гарантирована (положительный показатель Ляпунова) Доказана (отрицательный показатель Ляпунова)
Дисперсия follow-on trace Бесконечная дисперсия Не уменьшена (проблема решена через регуляризацию, а не снижение дисперсии)
Точность восстановления Точное восстановление фиксированной точки ETD
Сложность реализации Базовая Требует хранения скалярного состояния с утечкой

Значение для индустрии

RETD меняет динамику post-shock, не снижая общую дисперсию следов. Это важное теоретическое и практическое достижение для reinforcement learning, где off-policy обучение часто сталкивается с проблемами нестабильности при использовании постоянных скоростей обучения. Метод позволяет использовать более агрессивные шаги обучения без риска расходимости, что критично для сложных сред.

Источник: arXiv cs.AI ↗