Релиз модели6 июля 2026 г., 10:16 МСК🤖 Auto

Gemma-3 на GSM8K: обучение через Tunix GRPO и LoRA

Разработчики представили полный пайплайн обучения Gemma-3 для структурированного математического рассуждения. Используя фреймворк Tunix, JAX и RL-подход GRPO, модель учится решать задачи GSM8K с точным соблюдением формата ответа.

Баннер новости 2945

Суть метода: Tunix, GRPO и JAX

В новой статье на MarkTechPost описан процесс обучения модели Gemma-3 (версии 1B IT) для решения математических задач уровня GSM8K. Ключевая особенность подхода — использование фреймворка Tunix (разработка Google) в связке с JAX и алгоритма GRPO (Group Relative Policy Optimization). Обучение происходит через подкрепление (RL), где модель получает награды за правильность ответа и соблюдение структуры рассуждения. При этом используются LoRA-адаптеры (Rank 32, Alpha 32.0), что позволяет обучать только малую часть параметров, сохраняя базовую модель неизменной и делая процесс совместимым с одним ускорителем (GPU/TPU).

Структурированное рассуждение и система наград

Модель не просто выдает ответ, а обязана следовать строгому шаблону: сначала идет логическое рассуждение в тегах <reasoning>...

Источник: MarkTechPost ↗