Проблема: «Бассейны ошибок» в RL
Обучение с подкреплением (RL) с верифицируемыми наградами стало стандартом для улучшения логического мышления больших языковых моделей (LLM). Однако авторы выявили критическое ограничение: на сложных задачах модель генерирует семантически избыточные ответы, сходящиеся в одни и те же ошибочные «бассейны рассуждений». Это снижает контраст наград и замедляет обновление политики.
Решение: W2SPO и вспомогательные ветви
Предложен метод W2SPO (Weak-to-Strong Off-Policy RL). Идея заключается в использовании более слабой, но быстрой вспомогательной модели для генерации коротких фрагментов (всего 8 токенов), которые внедряются в траекторию основной модели. Основная модель затем дописывает решение, начиная с этой точки. Обновление политики происходит только на основе финальной верифицируемой награды за эти короткие вставки.
Результаты: Скорость и точность
Эксперименты показали, что подход W2SPO превосходит базовые методы пост-обучения. При сравнении с классическим алгоритмом GRPO при том же бюджете сэмплирования:
- Метрика Pass@1 выросла с 62.3% до 64.2%.
- Скорость обучения увеличилась в 3.55 раза.
Значение для индустрии
Метод демонстрирует, что для расширения локального исследования пространства решений не всегда нужны дорогие вычисления. Использование «слабых» моделей для генерации гипотез позволяет сильной модели быстрее находить оптимальные пути рассуждения, экономя ресурсы при обучении моделей масштаба 4B.
| Метрика | Vanilla GRPO | W2SPO (предложенный метод) |
|---|---|---|
| Pass@1 | 62.3% | 64.2% |
| Скорость обучения | 1x (база) | 3.55x |
| Длина вспомогательной ветви | Не применяется | 8 токенов |
Источник: arXiv cs.AI ↗
