Главная/Блог/Аналитика/NVIDIA Molt: PyTorch-нативная платформа…
Аналитика9 мин чтения · 2 августа 2026 г.

NVIDIA Molt: PyTorch-нативная платформа для агентного RL

Разбираем архитектуру Molt от NVIDIA: как компактный фреймворк упрощает разработку агентов на PyTorch, используя Ray, vLLM и FSDP2 без форков.

NVIDIA Molt: PyTorch-нативная платформа для агентного RL

Разработка агентов на основе подкрепления (Agentic Reinforcement Learning) — это не просто еще один шаг в эволюции больших языковых моделей. Это фундаментальный сдвиг в парадигме обучения, где модель не просто предсказывает следующий токен, а принимает решения, взаимодействует с окружением и корректирует свои действия на основе долгосрочных наград. Однако за этим блеском скрывается огромная техническая сложность. Исследователи постоянно сталкиваются с необходимостью модификации алгоритмов: появляются новые оценщики (estimators), меняются этапы пайплайна, внедряются новые схемы отката (rollout schemes). В традиционных фреймворках каждое такое изменение требует прокладки через слои тренировочных движков, распределенных бэкендов и «клеящего» кода для синхронизации. Эта накладная стоимость ложится на плечи исследователя, замедляя итерации и увеличивая вероятность ошибок.

Именно на решение этой проблемы направлена новая разработка от команды NVIDIA NeMo — фреймворк Molt. Это не просто еще одна библиотека для обучения LLM. Molt позиционируется как PyTorch-нативная платформа для агентного обучения, спроектированная с необычной, но крайне прагматичной целью: кодовая база должна быть настолько компактной, чтобы исследователь мог держать ее всю в голове, а ИИ-ассистент по кодированию мог прочитать и осмыслить целиком. В мире, где модели достигают сотен миллиардов параметров, обратная совместимость и прозрачность кода становятся критически важными активами.

01Философия компактности: почему 8.6K строк важнее 62K

Цифры, которые NVIDIA приводит в документации Molt, могут показаться сухими, но за ними стоит глубокий архитектурный выбор. Заявленный объем кодовой базы Molt составляет примерно 8.6 тысяч строк RL-кода. Для сравнения, тот же метод, измеренный по графу импорта из точки входа RL, насчитывает около 62 тысяч строк в фреймворке verl, 25 тысяч в slime и 7.2 тысячи в OpenRLHF. Разница в 7 раз между Molt и verl не является случайной — это результат сознательного отказа от избыточной абстракции.

Почему это важно? В сложных системах, таких как распределенное обучение агентов, «черные ящики» становятся главным врагом отладки. Когда вы используете фреймворк с десятками тысяч строк скрытой логики, поиск бага в градиентах или синхронизации становится игрой в угадайку. Molt же предлагает подход, при котором исследователь понимает, что происходит на каждом шаге. Это особенно критично в агентном RL, где траектория обучения может зависеть от тонких нюансов взаимодействия между политикой (policy) и окружением (environment). Компактность кода также означает, что ИИ-ассистенты (такие как GitHub Copilot или Cursor) могут эффективно анализировать весь контекст проекта, предлагая более точные исправления и оптимизации, чем при работе с монолитными, запутанными кодовыми базами.

💡
Совет исследователю. Компактность кода Molt позволяет быстро адаптировать фреймворк под специфические задачи. Если вам нужно изменить логику сбора наград или внедрить кастомный алгоритм exploration, вы не будете копаться в чужом коде, а сможете написать свою логику поверх существующей структуры, сохраняя контроль над процессом обучения.

02Архитектурный синтез: Ray, vLLM и NVIDIA AutoModel

Одним из самых сильных сторон Molt является его подход к интеграции существующих технологий. Фреймворк не изобретает велосипед заново. Вместо этого он композирует три мощных компонента, ни один из которых не был форкнут (разветвлен и модифицирован независимо):

  • Ray используется для размещения ресурсов и асинхронных очередей. Ray обеспечивает масштабируемость и управление распределенными задачами, что критично для работы с множеством агентов одновременно.
  • vLLM отвечает за rollout (генерацию ответов). Это один из самых быстрых движков для вывода LLM, оптимизированный для высокой пропускной способности.
  • NVIDIA AutoModel с FSDP2 (Fully Sharded Data Parallelism 2-го поколения) используется для непосредственного обучения модели. FSDP2 позволяет эффективно распределять параметры модели по множеству GPU, снижая требования к памяти.

Отказ от форков означает, что улучшения в upstream-релизах (основных версиях Ray, vLLM или PyTorch) поступают в Molt автоматически, просто путем обновления версии контейнера. Это избавляет команду от необходимости постоянно поддерживать собственные патчи и ребазы, что является огромной проблемой для многих open-source проектов. Исследователь получает доступ к самым свежим оптимизациям производительности без дополнительных усилий по интеграции.

NVIDIA Molt: PyTorch-нативная платформа для агентного RL

03Время выполнения: пул агентов и потоковая передача

Как же работает этот синтез на практике? Рантайм Molt строится вокруг концепции пула агентов. Это набор движков vLLM, стоящих за маршрутизатором запросов, и один обучаемый актор-политика. Ключевая инновация здесь — использование потокового пула (streaming pool). Он удерживает группы промптов в активном состоянии, гарантируя, что движки vLLM никогда не простаивают в ожидании данных, пока актор обучается.

Процесс выглядит следующим образом:

  1. Генерация: Актор-политика генерирует действия, которые отправляются в пул агентов через vLLM.
  2. Частичный откат (Partial Rollout): Когда требуется обновление модели, движки vLLM приостанавливаются. Шарды (части) модели актора передаются напрямую каждому движку через NCCL (NVIDIA Collective Communications Library). Это происходит быстрее, чем передача через сеть или диск.
  3. Возобновление: Вместо того чтобы выбрасывать незавершенные запросы, Molt возобновляет их, используя обновленные веса. Это сохраняет контекст и эффективность вычислений.

Такой подход минимизирует простои GPU, которые часто являются узким местом в распределенном обучении. В традиционных пайплайнах, когда модель обновляется, вся генерация останавливается, и GPU простаивают. Molt же обеспечивает непрерывный поток данных, что значительно повышает общую пропускную способность системы.

⚠️
Важно. Для корректной работы такого пайплайна требуется высокая скорость обмена данными между GPU. Использование NCCL и локальных сетей (InfiniBand или NVLink) критически важно для достижения заявленной производительности. На стандартных сетевых конфигурациях задержки могут нивелировать преимущества потоковой передачи.

04Агент как обычная программа: гибкость через SDK

Еще одна революционная идея Molt — подход к определению агента. В большинстве фреймворков RL агент — это сложный объект с множеством внутренних состояний и методов. В Molt агент — это просто Python-модуль, экспортирующий класс AgentRunner. Все остальное — обычный код, включая логику вознаграждения (reward).

Поддерживаются две основные формы взаимодействия:

NVIDIA Molt: PyTorch-нативная платформа для агентного RL
  1. Env (Gymnasium-aligned): Фреймворк управляет циклом LLM через метод step(), совместимый с библиотекой Gymnasium. Это удобно для стандартных задач, где окружение полностью контролируется фреймворком.
  2. ChatAgent: Пользователь управляет циклом через стандартные SDK OpenAI или Anthropic. Molt запускает сервер-петлю (loopback server), который принимает запросы по обоим протоколам и декодирует их на стороне сервера в точное накопление токенов (token-exact accumulation).

Это означает, что вы можете использовать существующие агенты, написанные для ChatGPT или Claude, и обучать их через RL, не переписывая их с нуля. Сервер Molt автоматически обрабатывает длинные контексты: если агент сжимает свой контекст и переписывает префикс, сервер запечатлевает текущий сегмент и автоматически открывает новый. Это решает одну из самых сложных проблем в агентном RL — управление бесконечными диалогами и историей взаимодействий.

05Три инварианта корректности: почему это не просто «еще один RL»

Архитектура Molt организована вокруг трех строгих инвариантов корректности, которые отличают его от многих прототипов. Эти правила гарантируют, что обучение будет стабильным и предсказуемым.

1. Идентичность токенов (Token Identity): Траектория определяется идентификаторами сэмплированных токенов, а не ретокенизированным текстом. Это предотвращает ошибки, возникающие при различиях в токенизации между этапами генерации и обучения.

2. Семантика версии политики (Policy-Version Semantics): Обучаемые токены сохраняют свои логарифмические вероятности (log-probabilities) поведенческой политики. Асинхронное использование корректируется для каждого токена за уровнем последовательности. Это критично, когда генерация опережает обучение, и модель уже изменилась.

3. Прямая согласованность (Forward Consistency): Rollout и актор должны согласовываться в семантике модели. Это особенно важно для моделей с архитектурой Mixture-of-Experts (MoE). В таких моделях маршрутизаторы для rollout и обучения могут выбирать разные эксперты из-за небольших численных различий. Molt решает эту проблему с помощью rollout routing replay: vLLM возвращает идентификаторы экспертов для каждого токена, а тренировочный forward-проход воспроизводит их. Это гарантирует, что градиенты вычисляются для тех же самых путей в сети, которые были использованы для генерации данных.

NVIDIA Molt: PyTorch-нативная платформа для агентного RL
📌
Факт. Проблема согласованности маршрутизации в MoE-моделях является одной из самых сложных в агентном RL. Без replay-механизма, реализованного в Molt, обучение может стать нестабильным или даже расходиться из-за рассинхронизации между тем, как модель генерирует данные, и тем, как она их обучается.

06Доступность и развертывание: от лаборатории к производству

Molt распространяется под лицензией Apache 2.0, что делает его привлекательным как для академических исследований, так и для коммерческого использования. Фреймворк поставляется с готовыми скриптами запуска, конфигурациями Slurm и предварительно собранным контейнером. Однако важно понимать, что исследовательская бумага позиционирует Molt как инфраструктуру для исследований, а не как готовый сервис для продакшн-обучения.

Рецепты развертывания предполагают использование 2 узлов с 8 GPU H100 каждый, разделенных на 8 для обучения и 8 для rollout. Это означает, что Molt доступен для передовых лабораторий, хорошо финансируемых стартапов, занимающихся пост-обучением, и корпоративных исследовательских групп в сфере финансов, здравоохранения и робототехники. Также он будет полезен академическим лабораториям с доступом к кластерам H100/H200.

Применения Molt разнообразны: от многошаговых агентов с использованием инструментов (tool-use) и агентов для выполнения кода до сред с визуальным языком (рецепт geo3k) и циклов вознаграждения LLM-as-judge. Также возможна он-политика дистилляции на меньшую модель-студент, что позволяет создавать эффективные агенты для развертывания на edge-устройствах.

07Что это значит на практике

Для исследователя и инженера, работающего с агентами, Molt предлагает несколько конкретных преимуществ:

  • Скорость итераций: Благодаря компактности кода и интеграции с ИИ-ассистентами, вы можете быстрее экспериментировать с новыми алгоритмами и исправлять ошибки.
  • Масштабируемость: Использование Ray и vLLM позволяет легко масштабировать обучение на сотни GPU, не переписывая архитектуру.
  • Гибкость: Возможность использовать стандартные SDK OpenAI/Anthropic для определения агентов снижает порог входа. Вы можете обучать существующих агентов, не создавая их с нуля.
  • Стабильность: Строгие инварианты корректности, особенно для MoE-моделей, обеспечивают более стабильное обучение и предсказуемые результаты.

Однако, как и любой инструмент для распределенного обучения, Molt требует значительных вычислительных ресурсов. Для успешного использования вам потребуется доступ к кластеру с GPU H100/H200 и опыт работы с распределенными системами. Тем не менее, для тех, кто готов к этому, Molt предлагает один из самых современных и эффективных подходов к агентному обучению с подкреплением на базе PyTorch.

В заключение, Molt от NVIDIA — это не просто еще один фреймворк. Это попытка упростить сложность агентного RL, вернув контроль исследователю через прозрачность, компактность и интеграцию лучших существующих технологий. Если вы работаете с большими моделями и хотите выйти за рамки простого fine-tuning, Molt может стать ключевым инструментом в вашем арсенале.

Источник: MarkTechPost ↗