Исследования21 июля 2026 г., 09:17 МСК🤖 Auto

W2SPO: Слабые модели ускоряют обучение сильных на 3.5x

Исследователи представили метод W2SPO, использующий слабые модели для генерации коротких ветвей рассуждений (8 токенов), что повышает точность и скорость обучения больших языковых моделей.

Баннер новости 4014

Проблема: «Бассейны ошибок» в RL

Обучение с подкреплением (RL) с верифицируемыми наградами стало стандартом для улучшения логического мышления больших языковых моделей (LLM). Однако авторы выявили критическое ограничение: на сложных задачах модель генерирует семантически избыточные ответы, сходящиеся в одни и те же ошибочные «бассейны рассуждений». Это снижает контраст наград и замедляет обновление политики.

Решение: W2SPO и вспомогательные ветви

Предложен метод W2SPO (Weak-to-Strong Off-Policy RL). Идея заключается в использовании более слабой, но быстрой вспомогательной модели для генерации коротких фрагментов (всего 8 токенов), которые внедряются в траекторию основной модели. Основная модель затем дописывает решение, начиная с этой точки. Обновление политики происходит только на основе финальной верифицируемой награды за эти короткие вставки.

Результаты: Скорость и точность

Эксперименты показали, что подход W2SPO превосходит базовые методы пост-обучения. При сравнении с классическим алгоритмом GRPO при том же бюджете сэмплирования:

  • Метрика Pass@1 выросла с 62.3% до 64.2%.
  • Скорость обучения увеличилась в 3.55 раза.

Значение для индустрии

Метод демонстрирует, что для расширения локального исследования пространства решений не всегда нужны дорогие вычисления. Использование «слабых» моделей для генерации гипотез позволяет сильной модели быстрее находить оптимальные пути рассуждения, экономя ресурсы при обучении моделей масштаба 4B.

Метрика Vanilla GRPO W2SPO (предложенный метод)
Pass@1 62.3% 64.2%
Скорость обучения 1x (база) 3.55x
Длина вспомогательной ветви Не применяется 8 токенов

Источник: arXiv cs.AI ↗