Проблема малых моделей и верификация
Малые языковые модели (Small Language Models, SLM) часто уступают большим аналогам в логических задачах. Ключевая проблема — отсутствие точной обратной связи при обучении. Статья исследует, как метод GRPO (Group Relative Policy Optimization) решает эту проблему, используя верифицируемые награды (verifiable rewards). Это позволяет модели учиться на объективно правильных ответах, а не на субъективных оценках.
Роль Unsloth и оптимизации
Эксперименты проводились с использованием фреймворка Unsloth, который обеспечивает ускорение обучения и снижение потребления памяти. GRPO группирует ответы модели и сравнивает их внутри группы, что делает процесс обучения более стабильным для малых архитектур. Важно отметить, что эффективность метода зависит не только от архитектуры, но и от качества функции вознаграждения.
Почему функция вознаграждения критична
Автор подчеркивает: "The reward function matters as much as the model". Если награда не может быть верифицирована (например, в открытых диалогах), модель не сможет научиться строгой логике. Верифицируемые награды работают там, где есть четкий критерий правильности: математика, код, логические задачи.
Практическая значимость
Использование GRPO с верифицируемыми наградами позволяет достичь высокой точности на локальных устройствах без необходимости в огромных вычислительных ресурсах. Это открывает путь к созданию эффективных SLM для edge-устройств и локальных инференс-серверов.
Источник: Towards Data Science ↗
