Проблема нулевой дисперсии в GRPO
Методы обучения с подкреплением без критика (Critic-free RL), такие как GRPO (Group Relative Policy Optimization), позволяют экономить вычислительные ресурсы, отказываясь от обучения функции ценности. Однако они критически зависят от локальной статистики наград внутри группы промптов. В сценариях с верифицируемыми наградами (Verifiable Rewards), где ответ либо верен, либо нет, возникает проблема: если все модели в группе дают одинаковый ответ, дисперсия наград падает до нуля. Это приводит к нулевым преимуществам (advantages) и полной остановке обучения модели, особенно на этапе холодного старта.
Решение: BV-Blend
Авторы (Yupeng Chang, Yuan Wu, Yi Chang) предлагают фреймворк BV-Blend, который стабилизирует оценку преимуществ. Метод работает по следующему алгоритму:
- Семантические кластеры: Система отслеживает исторические моменты наград (reward moments) для каждого семантического кластера задач.
- Взвешивание по неопределенности: Используется стандартная ошибка среднего (SEM) как прокси-метрика для вычисления веса уверенности.
- Смешивание (Blending): Исторические данные и локальные on-policy статистики объединяются для формирования стандартизированного преимущества, совместимого с PPO-подобными обрезанными обновлениями.
Результаты и значимость
Эксперименты на бенчмарках с верифицируемыми рассуждениями показали, что BV-Blend не только повышает стабильность обучения, но и сохраняет эффективность в тех режимах, где стандартные методы с групповой нормализацией «застывают». Это открывает путь к более надежному обучению больших языковых моделей в задачах, требующих строгой проверки ответа, без необходимости содержать тяжелый модуль критика.
Источник: arXiv cs.AI ↗
