Разработка агентов на основе подкрепления (Agentic Reinforcement Learning) — это не просто еще один шаг в эволюции больших языковых моделей. Это фундаментальный сдвиг в парадигме обучения, где модель не просто предсказывает следующий токен, а принимает решения, взаимодействует с окружением и корректирует свои действия на основе долгосрочных наград. Однако за этим блеском скрывается огромная техническая сложность. Исследователи постоянно сталкиваются с необходимостью модификации алгоритмов: появляются новые оценщики (estimators), меняются этапы пайплайна, внедряются новые схемы отката (rollout schemes). В традиционных фреймворках каждое такое изменение требует прокладки через слои тренировочных движков, распределенных бэкендов и «клеящего» кода для синхронизации. Эта накладная стоимость ложится на плечи исследователя, замедляя итерации и увеличивая вероятность ошибок.
Именно на решение этой проблемы направлена новая разработка от команды NVIDIA NeMo — фреймворк Molt. Это не просто еще одна библиотека для обучения LLM. Molt позиционируется как PyTorch-нативная платформа для агентного обучения, спроектированная с необычной, но крайне прагматичной целью: кодовая база должна быть настолько компактной, чтобы исследователь мог держать ее всю в голове, а ИИ-ассистент по кодированию мог прочитать и осмыслить целиком. В мире, где модели достигают сотен миллиардов параметров, обратная совместимость и прозрачность кода становятся критически важными активами.
01Философия компактности: почему 8.6K строк важнее 62K
Цифры, которые NVIDIA приводит в документации Molt, могут показаться сухими, но за ними стоит глубокий архитектурный выбор. Заявленный объем кодовой базы Molt составляет примерно 8.6 тысяч строк RL-кода. Для сравнения, тот же метод, измеренный по графу импорта из точки входа RL, насчитывает около 62 тысяч строк в фреймворке verl, 25 тысяч в slime и 7.2 тысячи в OpenRLHF. Разница в 7 раз между Molt и verl не является случайной — это результат сознательного отказа от избыточной абстракции.
Почему это важно? В сложных системах, таких как распределенное обучение агентов, «черные ящики» становятся главным врагом отладки. Когда вы используете фреймворк с десятками тысяч строк скрытой логики, поиск бага в градиентах или синхронизации становится игрой в угадайку. Molt же предлагает подход, при котором исследователь понимает, что происходит на каждом шаге. Это особенно критично в агентном RL, где траектория обучения может зависеть от тонких нюансов взаимодействия между политикой (policy) и окружением (environment). Компактность кода также означает, что ИИ-ассистенты (такие как GitHub Copilot или Cursor) могут эффективно анализировать весь контекст проекта, предлагая более точные исправления и оптимизации, чем при работе с монолитными, запутанными кодовыми базами.
02Архитектурный синтез: Ray, vLLM и NVIDIA AutoModel
Одним из самых сильных сторон Molt является его подход к интеграции существующих технологий. Фреймворк не изобретает велосипед заново. Вместо этого он композирует три мощных компонента, ни один из которых не был форкнут (разветвлен и модифицирован независимо):
- Ray используется для размещения ресурсов и асинхронных очередей. Ray обеспечивает масштабируемость и управление распределенными задачами, что критично для работы с множеством агентов одновременно.
- vLLM отвечает за rollout (генерацию ответов). Это один из самых быстрых движков для вывода LLM, оптимизированный для высокой пропускной способности.
- NVIDIA AutoModel с FSDP2 (Fully Sharded Data Parallelism 2-го поколения) используется для непосредственного обучения модели. FSDP2 позволяет эффективно распределять параметры модели по множеству GPU, снижая требования к памяти.
Отказ от форков означает, что улучшения в upstream-релизах (основных версиях Ray, vLLM или PyTorch) поступают в Molt автоматически, просто путем обновления версии контейнера. Это избавляет команду от необходимости постоянно поддерживать собственные патчи и ребазы, что является огромной проблемой для многих open-source проектов. Исследователь получает доступ к самым свежим оптимизациям производительности без дополнительных усилий по интеграции.

03Время выполнения: пул агентов и потоковая передача
Как же работает этот синтез на практике? Рантайм Molt строится вокруг концепции пула агентов. Это набор движков vLLM, стоящих за маршрутизатором запросов, и один обучаемый актор-политика. Ключевая инновация здесь — использование потокового пула (streaming pool). Он удерживает группы промптов в активном состоянии, гарантируя, что движки vLLM никогда не простаивают в ожидании данных, пока актор обучается.
Процесс выглядит следующим образом:
- Генерация: Актор-политика генерирует действия, которые отправляются в пул агентов через vLLM.
- Частичный откат (Partial Rollout): Когда требуется обновление модели, движки vLLM приостанавливаются. Шарды (части) модели актора передаются напрямую каждому движку через NCCL (NVIDIA Collective Communications Library). Это происходит быстрее, чем передача через сеть или диск.
- Возобновление: Вместо того чтобы выбрасывать незавершенные запросы, Molt возобновляет их, используя обновленные веса. Это сохраняет контекст и эффективность вычислений.
Такой подход минимизирует простои GPU, которые часто являются узким местом в распределенном обучении. В традиционных пайплайнах, когда модель обновляется, вся генерация останавливается, и GPU простаивают. Molt же обеспечивает непрерывный поток данных, что значительно повышает общую пропускную способность системы.
04Агент как обычная программа: гибкость через SDK
Еще одна революционная идея Molt — подход к определению агента. В большинстве фреймворков RL агент — это сложный объект с множеством внутренних состояний и методов. В Molt агент — это просто Python-модуль, экспортирующий класс AgentRunner. Все остальное — обычный код, включая логику вознаграждения (reward).
Поддерживаются две основные формы взаимодействия:

- Env (Gymnasium-aligned): Фреймворк управляет циклом LLM через метод
step(), совместимый с библиотекой Gymnasium. Это удобно для стандартных задач, где окружение полностью контролируется фреймворком. - ChatAgent: Пользователь управляет циклом через стандартные SDK OpenAI или Anthropic. Molt запускает сервер-петлю (loopback server), который принимает запросы по обоим протоколам и декодирует их на стороне сервера в точное накопление токенов (token-exact accumulation).
Это означает, что вы можете использовать существующие агенты, написанные для ChatGPT или Claude, и обучать их через RL, не переписывая их с нуля. Сервер Molt автоматически обрабатывает длинные контексты: если агент сжимает свой контекст и переписывает префикс, сервер запечатлевает текущий сегмент и автоматически открывает новый. Это решает одну из самых сложных проблем в агентном RL — управление бесконечными диалогами и историей взаимодействий.
05Три инварианта корректности: почему это не просто «еще один RL»
Архитектура Molt организована вокруг трех строгих инвариантов корректности, которые отличают его от многих прототипов. Эти правила гарантируют, что обучение будет стабильным и предсказуемым.
1. Идентичность токенов (Token Identity): Траектория определяется идентификаторами сэмплированных токенов, а не ретокенизированным текстом. Это предотвращает ошибки, возникающие при различиях в токенизации между этапами генерации и обучения.
2. Семантика версии политики (Policy-Version Semantics): Обучаемые токены сохраняют свои логарифмические вероятности (log-probabilities) поведенческой политики. Асинхронное использование корректируется для каждого токена за уровнем последовательности. Это критично, когда генерация опережает обучение, и модель уже изменилась.
3. Прямая согласованность (Forward Consistency): Rollout и актор должны согласовываться в семантике модели. Это особенно важно для моделей с архитектурой Mixture-of-Experts (MoE). В таких моделях маршрутизаторы для rollout и обучения могут выбирать разные эксперты из-за небольших численных различий. Molt решает эту проблему с помощью rollout routing replay: vLLM возвращает идентификаторы экспертов для каждого токена, а тренировочный forward-проход воспроизводит их. Это гарантирует, что градиенты вычисляются для тех же самых путей в сети, которые были использованы для генерации данных.

06Доступность и развертывание: от лаборатории к производству
Molt распространяется под лицензией Apache 2.0, что делает его привлекательным как для академических исследований, так и для коммерческого использования. Фреймворк поставляется с готовыми скриптами запуска, конфигурациями Slurm и предварительно собранным контейнером. Однако важно понимать, что исследовательская бумага позиционирует Molt как инфраструктуру для исследований, а не как готовый сервис для продакшн-обучения.
Рецепты развертывания предполагают использование 2 узлов с 8 GPU H100 каждый, разделенных на 8 для обучения и 8 для rollout. Это означает, что Molt доступен для передовых лабораторий, хорошо финансируемых стартапов, занимающихся пост-обучением, и корпоративных исследовательских групп в сфере финансов, здравоохранения и робототехники. Также он будет полезен академическим лабораториям с доступом к кластерам H100/H200.
Применения Molt разнообразны: от многошаговых агентов с использованием инструментов (tool-use) и агентов для выполнения кода до сред с визуальным языком (рецепт geo3k) и циклов вознаграждения LLM-as-judge. Также возможна он-политика дистилляции на меньшую модель-студент, что позволяет создавать эффективные агенты для развертывания на edge-устройствах.
07Что это значит на практике
Для исследователя и инженера, работающего с агентами, Molt предлагает несколько конкретных преимуществ:
- Скорость итераций: Благодаря компактности кода и интеграции с ИИ-ассистентами, вы можете быстрее экспериментировать с новыми алгоритмами и исправлять ошибки.
- Масштабируемость: Использование Ray и vLLM позволяет легко масштабировать обучение на сотни GPU, не переписывая архитектуру.
- Гибкость: Возможность использовать стандартные SDK OpenAI/Anthropic для определения агентов снижает порог входа. Вы можете обучать существующих агентов, не создавая их с нуля.
- Стабильность: Строгие инварианты корректности, особенно для MoE-моделей, обеспечивают более стабильное обучение и предсказуемые результаты.
Однако, как и любой инструмент для распределенного обучения, Molt требует значительных вычислительных ресурсов. Для успешного использования вам потребуется доступ к кластеру с GPU H100/H200 и опыт работы с распределенными системами. Тем не менее, для тех, кто готов к этому, Molt предлагает один из самых современных и эффективных подходов к агентному обучению с подкреплением на базе PyTorch.
В заключение, Molt от NVIDIA — это не просто еще один фреймворк. Это попытка упростить сложность агентного RL, вернув контроль исследователю через прозрачность, компактность и интеграцию лучших существующих технологий. Если вы работаете с большими моделями и хотите выйти за рамки простого fine-tuning, Molt может стать ключевым инструментом в вашем арсенале.
Источник: MarkTechPost ↗
