alibaba/ROLL

An Efficient and User-Friendly Scaling Library for Reinforcement Learning with Large Language Models

Обучение⭐ 3 401Pythonпоследний релиз: v0.3.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

ROLL — это эффективная библиотека для обучения моделей с подкреплением (RL) больших языковых моделей (LLM) с использованием распределенных GPU-ресурсов.

Зачем нужен

Инструмент оптимизирует процессы тонкой настройки LLM, такие как выравнивание по человеческим предпочтениям, сложное логическое мышление и многошаговое взаимодействие агентов. Он полезен за счет интеграции с SGLang, vLLM и Megatron-Core, что позволяет ускорить обучение и инференс на масштабе.

Что можно реализовать

  • Обучение LLM с подкреплением (RLVR) для улучшения качества ответов и логики
  • Разработка и обучение AI-агентов для многошаговых сценариев взаимодействия
  • Использование стратегий FSDP2 и Megatron с LoRA для эффективного обучения
  • Запуск обучения на гибридном оборудовании, включая поддержку Ascend NPU
  • Применение асинхронных методов ускорения (RollFlash) для пост-обучения

Ключевые возможности

  • Многоуровневая распределенная архитектура на базе Ray для гибкого управления ресурсами
  • Интеграция с SGLang, vLLM и Megatron-Core для ускорения инференса и обучения
  • Поддержка современных моделей, включая Qwen3.5 (Dense и MoE)
  • Наличие специализированных алгоритмов, таких как ROME и IPA для агентов
  • Активная разработка: регулярные обновления и публикации в arXiv (OSDI’26 и др.)

👤 Кому подойдёт: ML-инженеры, исследователи в области LLM и разработчики, работающие с масштабным обучением моделей на GPU/NPU кластерах

Релизы

v0.3.0major
🕐 3 мес назад · релиз на GitHub ↗

ROLL v0.3.0: добавлена поддержка видео/аудио RLVR, AgentRunner 2.0, MTP, OpenTelemetry и оптимизация RemoteBatch.

  • Added: Добавлена поддержка RLVR для видео и аудио, а также MTP-тренинг для Qwen3.5/3.6.
  • Added: Выпущен AgentRunner 2.0 с абстракцией взаимодействия и интеграцией Atropos/OpenReward.
  • Added: Внедрена OpenTelemetry для распределенного трейсинга и MoE Router Replay (R3).
  • Added: Оптимизирован RemoteBatch с ленивой передачей данных и улучшена работа с NPU/AMD.
  • Deprecated: Удалена поддержка стратегии DeepSpeed и переписан Wan RewardRL.