Релиз модели23 июля 2026 г., 19:17 МСК🤖 Auto

NVIDIA Nemotron 3 Nano: кастомизация за 5 минут через Prime Intellect

NVIDIA и Prime Intellect представили упрощенный пайплайн настройки модели Nemotron 3 Nano с помощью RLVR. Базовая оценка и обучение занимают около 5 минут, а результатом становится готовый LoRA-адаптер.

Баннер новости 4222

Быстрый старт без инфраструктуры

Компания NVIDIA совместно с Prime Intellect устранила главное препятствие для внедрения кастомизации LLM — необходимость в сложной инфраструктуре и экспертных знаниях. Теперь разработчики могут настроить модель NVIDIA Nemotron 3 Nano (архитектура 30B-A3B) с помощью хостинга обучения за считанные минуты. Процесс полностью управляется через CLI Prime Intellect, что исключает необходимость локального управления GPU-кластерами.

Метрики и результаты: от хаоса к точности

В качестве тестового сценария использовалась среда Python Math, где модель должна решать математические задачи с использованием библиотек numpy, sympy и scipy. Изначально базовая модель демонстрировала крайне низкую эффективность, что подчеркивает необходимость дообучения.

Ниже приведены ключевые метрики базовой оценки (baseline) перед применением Reinforcement Learning with Verifiable Rewards (RLVR):

Метрика Значение Комментарий
Средняя награда (avg reward) 0.219 Низкий показатель, свидетельствующий о плохом качестве ответов
Стандартное отклонение (std) 0.413 Высокая вариативность результатов
Параметры оценки 32 примера, 8 воркеров Конфигурация для быстрой валидации гипотезы

Технический стек и воспроизводимость

Ключевое преимущество подхода — полная открытость. NVIDIA опубликовала не только веса модели, но и данные, код оценки и рецепты обучения. Это позволяет разработчикам не просто «черным ящиком» использовать модель, а понимать, как именно она была обучена, и воспроизводить результаты. Пайплайн включает три этапа:

  • Baseline: Оценка исходной модели на тестовом наборе данных.
  • Training: Применение RLVR в среде Python Math с ограничением в 5 ходов (turns) для предотвращения бесконечных циклов вызова инструментов.
  • Re-evaluation: Сравнение результатов и экспорт готового LoRA-адаптера для деплоя.

Масштабируемость решения

Хотя в статье детально разобран процесс для версии Nano, описанный workflow применим ко всей линейке NVIDIA Nemotron 3, включая модели Super и Ultra. Использование Prime Intellect Lab позволяет абстрагироваться от сложностей оркестрации контейнеров и управления жизненным циклом GPU, делая продвинутое дообучение доступным для широкого круга разработчиков.

Источник: NVIDIA dev blog ↗