Масштаб обучения Nemotron 3 Super
NVIDIA опубликовала детали пост-обучения модели Nemotron 3 Super, которая стала результатом применения Reinforcement Learning with Verifiable Rewards (RLVR). Ключевая метрика проекта — обработка 1.2 миллиона окружных роллаутов (environment rollouts). Обучение проводилось с использованием экосистемы NeMo RL, включающей инструменты NeMo Gym (для симуляции окружений) и NeMo Data Designer (для генерации синтетических данных).
Модель была протестирована на 37 наборах данных с применением 21 специализированного верификатора. Этот подход позволяет не просто «подгонять» модель под промпты, а формировать поведение через систему вознаграждений, что критически важно для сложных агентов, работающих с инструментами и длинными последовательностями действий.
Почему RLVR и GRPO лучше SFT для агентов
Статья подчеркивает, что традиционные методы, такие как Supervised Fine-Tuning (SFT) или Retrieval-Augmented Generation (RAG), часто не справляются с ошибками в многошаговых рабочих процессах. Если агент ошибается в вызове инструментов или формате вывода, промпты не помогут — нужна коррекция весов модели.
Для задач, где успех можно проверить алгоритмически (валидный JSON, прохождение тестов, корректность CLI-команд), NVIDIA рекомендует связку RLVR + GRPO (Group Relative Policy Optimization). В отличие от PPO, GRPO имеет меньше гиперпараметров и естественным образом работает с правил-бейсд вознаграждениями, что делает его стартовой точкой для большинства агентов.
Сравнение методов обучения
Выбор метода зависит от доступных сигналов обратной связи. Ниже приведена матрица принятия решений, описанная в блоге NVIDIA:
| Проблема модели | Рекомендуемый метод | Условие применения |
|---|---|---|
| Нехватка предметных знаний | RAG / Инжекция данных | Модель не знает фактов, но понимает инструкции |
| Нарушение формата вывода | Prompting → SFT | Нужно научить модель строгому формату |
| Необходимость имитации примеров | SFT (LoRA/QLoRA) | Есть демонстрации желаемого поведения |
| Есть предпочтения «лучше/хуже» | DPO | Нет алгоритмической проверки, есть пары ответов |
| Успех проверяется алгоритмически | RLVR с GRPO | Можно проверить JSON, код, тесты, симуляции |
| Сложные многошаговые агенты | Environment-based RL | Траекторные вознаграждения за длинные сессии |
Архитектура минимального RL-контура
Для запуска собственного обучения агентов NVIDIA выделяет 7 ключевых компонентов пайплайна:
- Policy model: Обучаемая модель (например, Nemotron).
- Task: Входные данные для агента.
- Action: Вывод модели, вызов инструмента или код-патч.
- Environment: Система, исполняющая действие (симулятор, терминал, API).
- Verifier: Код или модель, оценивающая успешность действия (reward signal).
- Rollouts: Сэмплированные попытки модели.
- Policy update: Шаг обучения, повышающий вероятность успешных действий.
Ключевой совет от экспертов NVIDIA: «Начинайте с оценки, а не с обучения». Перед запуском RL необходимо протестировать текущую модель на отложенной выборке, чтобы понять, где она ошибается, и убедиться, что верификатор корректно оценивает как успех, так и провал. Если верификатор ошибается, RL оптимизирует неправильное поведение.
Источник: NVIDIA dev blog ↗
