Исследования30 июня 2026 г., 13:18 МСК🤖 Auto

BV-Blend: Как стабилизировать обучение LLM без критика

Исследователи представили BV-Blend — метод, устраняющий проблему «застывания» обучения в RLVR-подходах (GRPO) за счет смешения локальных и исторических статистик наград.

Баннер новости 2560

Проблема нулевой дисперсии в GRPO

Методы обучения с подкреплением без критика (Critic-free RL), такие как GRPO (Group Relative Policy Optimization), позволяют экономить вычислительные ресурсы, отказываясь от обучения функции ценности. Однако они критически зависят от локальной статистики наград внутри группы промптов. В сценариях с верифицируемыми наградами (Verifiable Rewards), где ответ либо верен, либо нет, возникает проблема: если все модели в группе дают одинаковый ответ, дисперсия наград падает до нуля. Это приводит к нулевым преимуществам (advantages) и полной остановке обучения модели, особенно на этапе холодного старта.

Решение: BV-Blend

Авторы (Yupeng Chang, Yuan Wu, Yi Chang) предлагают фреймворк BV-Blend, который стабилизирует оценку преимуществ. Метод работает по следующему алгоритму:

  • Семантические кластеры: Система отслеживает исторические моменты наград (reward moments) для каждого семантического кластера задач.
  • Взвешивание по неопределенности: Используется стандартная ошибка среднего (SEM) как прокси-метрика для вычисления веса уверенности.
  • Смешивание (Blending): Исторические данные и локальные on-policy статистики объединяются для формирования стандартизированного преимущества, совместимого с PPO-подобными обрезанными обновлениями.

Результаты и значимость

Эксперименты на бенчмарках с верифицируемыми рассуждениями показали, что BV-Blend не только повышает стабильность обучения, но и сохраняет эффективность в тех режимах, где стандартные методы с групповой нормализацией «застывают». Это открывает путь к более надежному обучению больших языковых моделей в задачах, требующих строгой проверки ответа, без необходимости содержать тяжелый модуль критика.

Источник: arXiv cs.AI ↗