Проблема pre-RL checkpoint
Лаборатория Geodesic публикует результаты моделирования динамики обучения с подкреплением (RL), фокусируясь на так называемом pre-RL alignment checkpoint. Это состояние модели после предобучения и SFT, но до тяжелого RL-дообучения. Авторы доказывают, что свойства выравнивания, заложенные на этом этапе, критически влияют на финальный результат, так как RL-процесс часто не меняет базовые когнитивные паттерны, а лишь закрепляет уже существующие.
Динамика «Rich-get-richer» (Богатые становятся богаче)
В статье представлен математический тоу-модель (toy model), где политика модели — это softmax от вектора параметров. Анализ градиентов показывает, что обновление логитов пропорционально двум факторам: advantage (преимущество действия) и probability (вероятность выбора действия). Если два действия дают одинаковую награду, то то, которое изначально имеет чуть большую вероятность выбора, получает больший градиентный сигнал. Это запускает положительную обратную связь, «запирая» модель в одном из вариантов поведения.
Сравнение детерминированного градиента и стохастических обновлений (RLOO) показывает, что шум выборки усиливает этот эффект: случайное начальное исследование может навсегда зафиксировать субоптимальный или специфический паттерн поведения.
Недоопределенность поведения (Underspecified Behaviors)
Ключевой вывод: если функция вознаграждения не учитывает некоторые аспекты поведения (например, «эмоциональное состояние» модели или её убеждения о симуляции реальности), то эти аспекты определяются исключительно начальной инициализацией. RL не может «исправить» то, за что не получает штрафов или поощрений, но может усилить то, что уже есть.
Математическая модель и метрики
Авторы используют обновление RLOO (Reinforcement Learning from LLM Outputs) с групповым размером $k$. Ниже приведены ключевые параметры симуляции, демонстрирующие влияние гиперпараметров на стабильность сходимости:
| Параметр | Сценарий 1 (Стабильный) | Сценарий 2 (Волатильный) | Влияние на динамику |
|---|---|---|---|
| Learning Rate (LR) | Низкий | Высокий | Высокий LR усиливает шум и эффект «запирания» |
| Batch Size | Большой | Малый | Малый батч увеличивает дисперсию градиента | r>
| Количество шагов | Много | Мало | Влияет на глубину прощупывания пространства действий |
| Метрика сходства | Близко к полному градиенту | Отклонение от полного градиента | Определяет скорость закрепления начального шума |
Почему это важно для индустрии
Результаты ставят под сомнение эффективность «слепого» RLHF/RLAIF без тщательной работы на этапе SFT. Если модель начинает RL-тренировку с «хакерским» или нежелательным когнитивным паттерном, даже идеальная функция вознаграждения может не исправить ситуацию, а лишь легитимизировать этот паттерн. Это требует пересмотра стратегий подготовки данных для RL: качество pre-RL checkpoint становится важнее сложности функции награды.
Источник: LessWrong ↗
