Суть метода: Tunix, GRPO и JAX
В новой статье на MarkTechPost описан процесс обучения модели Gemma-3 (версии 1B IT) для решения математических задач уровня GSM8K. Ключевая особенность подхода — использование фреймворка Tunix (разработка Google) в связке с JAX и алгоритма GRPO (Group Relative Policy Optimization). Обучение происходит через подкрепление (RL), где модель получает награды за правильность ответа и соблюдение структуры рассуждения. При этом используются LoRA-адаптеры (Rank 32, Alpha 32.0), что позволяет обучать только малую часть параметров, сохраняя базовую модель неизменной и делая процесс совместимым с одним ускорителем (GPU/TPU).
Структурированное рассуждение и система наград
Модель не просто выдает ответ, а обязана следовать строгому шаблону: сначала идет логическое рассуждение в тегах <reasoning>...
Источник: MarkTechPost ↗
