volcengine/verl

verl/HybridFlow: A Flexible and Efficient RL Post-Training Framework

Обучение⭐ 23 507Pythonпоследний релиз: v0.9.1
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

verl — это библиотека для обучения больших языковых моделей (LLM) методом Reinforcement Learning (RL), разработанная ByteDance Seed team.

Зачем нужен

Инструмент решает задачу эффективного пост-обучения LLM, позволяя гибко реализовывать сложные алгоритмы RL, такие как PPO и GRPO. Он полезен за счет высокой пропускной способности и интеграции с популярными инфраструктурными решениями, что ускоряет разработку и снижает затраты на вычисления.

Что можно реализовать

  • Реализация алгоритмов RLHF, включая PPO и GRPO, с минимальным количеством кода.
  • Обучение моделей масштаба триллионов параметров на больших кластерах GPU (например, 64 H800).
  • Создание и обучение LLM-агентов (LLM agents) в масштабе с использованием фреймворка uni-agent.
  • Пост-обучение диффузионных и омни-модальных моделей через стек VeRL-Omni.

Ключевые возможности

  • Поддержка гибридного контроллера для гибкого построения RL-пайплайнов.
  • Интеграция с FSDP, Megatron-LM, vLLM и SGLang.
  • Технология 3D-HybridEngine для устранения избыточности памяти и снижения накладных расходов при переключении между обучением и генерацией.
  • Гибкое распределение моделей по GPU для эффективного использования ресурсов кластера.
  • Готовая интеграция с моделями из HuggingFace.

👤 Кому подойдёт: ML-инженеры, исследователи в области LLM и разработчики, занимающиеся пост-обучением больших моделей.

Релизы

v0.9.1major
🕐 вчера · релиз на GitHub ↗

Версия 0.9.1: унифицированный V1-тренажер, ускорение FSDP через Liger Kernel, плагинный роутер vLLM и поддержка Qwen3.5/DeepSeek-V4.

  • Added: Представлен унифицированный V1 Trainer с асинхронной семантикой, динамической упаковкой микро-батчей и гибкой фильтрацией групп.
  • Added: Интеграция Liger Kernel v0.8.2 для FSDP: ускорение обновлений актора на 13.5% и снижение пиковой памяти на 5.6%.
  • Added: Плагинный роутер в vLLM: балансировка нагрузки вынесена в отдельный модуль с поддержкой внешних конфигураций.
  • Added: Добавлены скрипты обучения Qwen3.5 (2B и 35B) и поддержка DeepSeek-V4 (QAT bf16 и экспертная параллельность).
  • Deprecated: Модули fully_async_policy и one_step_off_policy устарели и будут перенесены в verl-recipe в следующем релизе.
v0.9.0major
🕐 1 мес назад · релиз на GitHub ↗

Версия v0.9.0: унифицированный трейнер, асинхронные чекпоинты delta_sharded, поддержка DeepSeek-V4 и оптимизатор Muon.

  • Added: Включен по умолчанию унифицированный трейнер v1, объединяющий синхронные и асинхронные режимы обучения.
  • Added: Добавлен движок чекпоинтов delta_sharded для асинхронного обновления весов с ускорением до 3.1x.
  • Added: Полная поддержка DeepSeek-V4: GRPO через Megatron-Bridge, VeOmni и фиксы квантования FP8/MXFP4.
  • Added: Поддержка оптимизатора Muon через Megatron-Core и динамическое планирование контекстного параллелизма.
  • Fixed: Исправления в vLLM и SGLang: детерминизм роллаута, поддержка ROCm и корректность LoRA.
v0.8.0majorbreaking
🕐 3 мес назад · релиз на GitHub ↗

Версия 0.8.0: асинхронный трейнер, OPD, поддержка Qwen3.5 и NPU, мажорные изменения архитектуры.

  • Added: Полностью асинхронный трейнер и поддержка On-Policy Distillation (OPD) для FSDP, Megatron и VeOmni.
  • Added: Добавлена поддержка Qwen3.5 (MTP SFT/RL, SP, GRPO) и обучение агентов через новый проект uni-agent.
  • Added: Расширена поддержка оборудования: NPU для Liger-Kernel, MXFP8 rollout на Ascend 950 и MoE-мониторинг.
  • Added: Улучшены бэкенды: vLLM 0.20.2, SGLang 0.5.12 с LoRA и TRT-LLM с асинхронным RL.
  • Breaking: Удалены устаревшие FSDP/Megatron воркеры, модуль interactions и диффузионный стек; main_ppo.py заменен на sync-версию.