Релиз модели1 июля 2026 г., 20:16 МСК🤖 Auto

NVIDIA Nemotron 3 Super: RL-обучение агентов на 1.2M роллаутов

NVIDIA представила Nemotron 3 Super, обученную через RLVR с использованием 21 верификатора NeMo Gym. Статья описывает практический пайплайн GRPO для создания надежных AI-агентов.

Баннер новости 2756

Масштаб обучения Nemotron 3 Super

NVIDIA опубликовала детали пост-обучения модели Nemotron 3 Super, которая стала результатом применения Reinforcement Learning with Verifiable Rewards (RLVR). Ключевая метрика проекта — обработка 1.2 миллиона окружных роллаутов (environment rollouts). Обучение проводилось с использованием экосистемы NeMo RL, включающей инструменты NeMo Gym (для симуляции окружений) и NeMo Data Designer (для генерации синтетических данных).

Модель была протестирована на 37 наборах данных с применением 21 специализированного верификатора. Этот подход позволяет не просто «подгонять» модель под промпты, а формировать поведение через систему вознаграждений, что критически важно для сложных агентов, работающих с инструментами и длинными последовательностями действий.

Почему RLVR и GRPO лучше SFT для агентов

Статья подчеркивает, что традиционные методы, такие как Supervised Fine-Tuning (SFT) или Retrieval-Augmented Generation (RAG), часто не справляются с ошибками в многошаговых рабочих процессах. Если агент ошибается в вызове инструментов или формате вывода, промпты не помогут — нужна коррекция весов модели.

Для задач, где успех можно проверить алгоритмически (валидный JSON, прохождение тестов, корректность CLI-команд), NVIDIA рекомендует связку RLVR + GRPO (Group Relative Policy Optimization). В отличие от PPO, GRPO имеет меньше гиперпараметров и естественным образом работает с правил-бейсд вознаграждениями, что делает его стартовой точкой для большинства агентов.

Сравнение методов обучения

Выбор метода зависит от доступных сигналов обратной связи. Ниже приведена матрица принятия решений, описанная в блоге NVIDIA:

Проблема модели Рекомендуемый метод Условие применения
Нехватка предметных знаний RAG / Инжекция данных Модель не знает фактов, но понимает инструкции
Нарушение формата вывода Prompting → SFT Нужно научить модель строгому формату
Необходимость имитации примеров SFT (LoRA/QLoRA) Есть демонстрации желаемого поведения
Есть предпочтения «лучше/хуже» DPO Нет алгоритмической проверки, есть пары ответов
Успех проверяется алгоритмически RLVR с GRPO Можно проверить JSON, код, тесты, симуляции
Сложные многошаговые агенты Environment-based RL Траекторные вознаграждения за длинные сессии

Архитектура минимального RL-контура

Для запуска собственного обучения агентов NVIDIA выделяет 7 ключевых компонентов пайплайна:

  • Policy model: Обучаемая модель (например, Nemotron).
  • Task: Входные данные для агента.
  • Action: Вывод модели, вызов инструмента или код-патч.
  • Environment: Система, исполняющая действие (симулятор, терминал, API).
  • Verifier: Код или модель, оценивающая успешность действия (reward signal).
  • Rollouts: Сэмплированные попытки модели.
  • Policy update: Шаг обучения, повышающий вероятность успешных действий.

Ключевой совет от экспертов NVIDIA: «Начинайте с оценки, а не с обучения». Перед запуском RL необходимо протестировать текущую модель на отложенной выборке, чтобы понять, где она ошибается, и убедиться, что верификатор корректно оценивает как успех, так и провал. Если верификатор ошибается, RL оптимизирует неправильное поведение.

Источник: NVIDIA dev blog ↗