rllm-org/rllm

Демократизация обучения с подкреплением для LLM

Агенты⭐ 5 828Pythonпоследний релиз: v0.3.0-pre
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

rLLM — это фреймворк с открытым исходным кодом для обучения языковых агентов с помощью методов обучения с подкреплением (RL). Он позволяет запускать агентов в различных средах и переключать бэкенды обучения одной командой.

Зачем нужен

Инструмент решает задачу унификации процесса RL-обучения LLM, позволяя использовать один и тот же код агента как для оценки (eval), так и для обучения. Это упрощает разработку, так как не нужно писать отдельные реализации для тестирования и обучения, а также поддерживает интеграцию с множеством популярных бэкендов и бенчмарков.

Что можно реализовать

  • Обучение агентов для написания кода (например, на базе SWE-bench или CodeX)
  • Решение математических задач и логических головоломок (MATH, AIME, GSM8K)
  • Тренировка агентов для работы в терминале и выполнения системных задач (Terminal-Bench)
  • Исследование эффективности различных алгоритмов RL (GRPO, REINFORCE) на разных моделях

Ключевые возможности

  • Поддержка любых агентов: от CLI-инструментов (Claude Code, Codex) до кастомных решений на LangGraph или OpenAI SDK
  • Гибкие среды выполнения (sandbox): Docker, Daytona, Modal или локальная среда с ускорением через snapshot
  • Множество бэкендов обучения: распределенный verl, однопользовательский tinker или облачный Fireworks
  • Встроенная поддержка 60+ бенчмарков для разных типов задач (код, математика, QA, VLM)
  • Прозрачный захват токенов и logprobs через Model Gateway без изменения кода агента

👤 Кому подойдёт: Исследователи в области AI, разработчики AI-агентов, инженеры по машинному обучению, работающие с RLHF и обучением LLM

Релизы

v0.3.0-premajorbreaking
🕐 4 мес назад · релиз на GitHub ↗

Релиз v0.3.0-pre: запуск асинхронного Unified Trainer, поддержка On-Policy Distillation, интеграция Verifiers и новые CLI-команды.

  • Added: Полностью асинхронный Unified Trainer с поддержкой предвычисленных преимуществ и новых методов оценки (REINFORCE++, RLOO).
  • Added: Добавлена поддержка On-Policy Distillation (OPD) и примеры обучения с использованием VLM.
  • Deprecated: Бэкенд Tinker перенесен в rllm.trainer.tinker; старые API в rllm.trainer.deprecated помечены как устаревшие.
  • Added: Новые CLI-команды: rllm login для аутентификации UI и улучшенный UILogger с фоновым потоком.
  • Added: Интеграция Verifiers, Prime Intellect Environment и добавление примера Geo3K Tinker.
  • Fixed: Исправлены ошибки в вычислении преимуществ, парсере Qwen и работе с Fireworks API.