Исследования14 июля 2026 г., 10:16 МСК🤖 Auto

Geodesic: Почему RL закрепляет «богатых» и как инициализация ломает выравнивание

Исследование Geodesic показывает, что RL-обучение работает по принципу «богатые становятся богаче»: начальная инициализация модели определяет её финальное поведение, а не только функция вознаграждения.

Баннер новости 3520

Проблема pre-RL checkpoint

Лаборатория Geodesic публикует результаты моделирования динамики обучения с подкреплением (RL), фокусируясь на так называемом pre-RL alignment checkpoint. Это состояние модели после предобучения и SFT, но до тяжелого RL-дообучения. Авторы доказывают, что свойства выравнивания, заложенные на этом этапе, критически влияют на финальный результат, так как RL-процесс часто не меняет базовые когнитивные паттерны, а лишь закрепляет уже существующие.

Динамика «Rich-get-richer» (Богатые становятся богаче)

В статье представлен математический тоу-модель (toy model), где политика модели — это softmax от вектора параметров. Анализ градиентов показывает, что обновление логитов пропорционально двум факторам: advantage (преимущество действия) и probability (вероятность выбора действия). Если два действия дают одинаковую награду, то то, которое изначально имеет чуть большую вероятность выбора, получает больший градиентный сигнал. Это запускает положительную обратную связь, «запирая» модель в одном из вариантов поведения.

Сравнение детерминированного градиента и стохастических обновлений (RLOO) показывает, что шум выборки усиливает этот эффект: случайное начальное исследование может навсегда зафиксировать субоптимальный или специфический паттерн поведения.

Недоопределенность поведения (Underspecified Behaviors)

Ключевой вывод: если функция вознаграждения не учитывает некоторые аспекты поведения (например, «эмоциональное состояние» модели или её убеждения о симуляции реальности), то эти аспекты определяются исключительно начальной инициализацией. RL не может «исправить» то, за что не получает штрафов или поощрений, но может усилить то, что уже есть.

Математическая модель и метрики

Авторы используют обновление RLOO (Reinforcement Learning from LLM Outputs) с групповым размером $k$. Ниже приведены ключевые параметры симуляции, демонстрирующие влияние гиперпараметров на стабильность сходимости:

r>
Параметр Сценарий 1 (Стабильный) Сценарий 2 (Волатильный) Влияние на динамику
Learning Rate (LR) Низкий Высокий Высокий LR усиливает шум и эффект «запирания»
Batch Size Большой Малый Малый батч увеличивает дисперсию градиента
Количество шагов Много Мало Влияет на глубину прощупывания пространства действий
Метрика сходства Близко к полному градиенту Отклонение от полного градиента Определяет скорость закрепления начального шума

Почему это важно для индустрии

Результаты ставят под сомнение эффективность «слепого» RLHF/RLAIF без тщательной работы на этапе SFT. Если модель начинает RL-тренировку с «хакерским» или нежелательным когнитивным паттерном, даже идеальная функция вознаграждения может не исправить ситуацию, а лишь легитимизировать этот паттерн. Это требует пересмотра стратегий подготовки данных для RL: качество pre-RL checkpoint становится важнее сложности функции награды.

Источник: LessWrong ↗