Проблема: Парадокс стабильности ETD
Emphatic Temporal-Difference (ETD) обучение известно своей способностью стабилизировать ожидаемые off-policy обновления TD и изменять геометрию проекции. Однако, как показывают новые исследования, эти свойства не гарантируют стабильности при использовании постоянного шага обучения (constant stepsize). Авторы демонстрируют эргодический контрпример с двумя состояниями, где среднее отображение ETD сжимается, но выборочное произведение имеет положительный верхний показатель Ляпунова. Это означает, что алгоритм может расходиться на практике, несмотря на теоретическую устойчивость в среднем.
Решение: Regularized Emphatic TD (RETD)
Для устранения этой проблемы предложен метод RETD. Ключевые особенности архитектуры:
- Нормализация после шока: Вводится первый порядок пост-шоковой коррекции.
- Сохранение структуры: Следы (traces) и коэффициенты важности (importance ratios) остаются неизменными.
- Утечка сигнала: Сигнал emphatic TD сохраняется в скалярном состоянии с «утечкой» (leaky scalar state), а коррекция выпускается с задержкой.
Математические гарантии и результаты
RETD обеспечивает сходимость почти наверное для гармонически убывающих шагов. Для постоянного шага доказан результат сжатия моментов при условии. Эксперименты на 10 000 запусков подтверждают:
- Восстановление фиксированной точки ETD точно (через single- и two-regularization readouts).
- Наличие сертифицированных отрицательных показателей Ляпунова на двух состояниях и одной точке Бэйда (Baird point).
- Существование немонотонной области стабильности, зависящей от задачи.
| Характеристика | ETD (стандартный) | RETD (предложенный) |
|---|---|---|
| Стабильность при постоянном шаге | Не гарантирована (положительный показатель Ляпунова) | Доказана (отрицательный показатель Ляпунова) |
| Дисперсия follow-on trace | Бесконечная дисперсия | Не уменьшена (проблема решена через регуляризацию, а не снижение дисперсии) |
| Точность восстановления | — | Точное восстановление фиксированной точки ETD |
| Сложность реализации | Базовая | Требует хранения скалярного состояния с утечкой |
Значение для индустрии
RETD меняет динамику post-shock, не снижая общую дисперсию следов. Это важное теоретическое и практическое достижение для reinforcement learning, где off-policy обучение часто сталкивается с проблемами нестабильности при использовании постоянных скоростей обучения. Метод позволяет использовать более агрессивные шаги обучения без риска расходимости, что критично для сложных сред.
Источник: arXiv cs.AI ↗
