langfengQ/verl-agent

verl-agent — это расширение veRL, предназначенное для обучения агентов LLM/VLM с помощью RL, а также официальный код к статье "Group-in-Group Policy Optimization for LLM Agent Training

Агенты⭐ 2 324Pythonпоследний релиз: v0.1.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

verl-agent — это расширение фреймворка veRL для обучения LLM/VLM агентов с помощью обучения с подкреплением (RL), основанное на алгоритме GiGPO.

Зачем нужен

Инструмент решает задачу эффективного обучения агентов в сложных многошаговых сценариях за счет механизма step-independent multi-turn rollout, который позволяет гибко управлять историей и памятью. Это полезно для создания reasoning-агентов, способных решать задачи с длинным горизонтом планирования, превосходящие стандартные подходы с простым конкатенированием истории.

Что можно реализовать

  • Обучение агентов для решения логических головоломок и навигации (например, Sokoban, ALFWorld)
  • Тренировка моделей для работы с веб-интерфейсами и электронной коммерцией (WebShop, AppWorld)
  • Разработка агентов с вызовом инструментов (Tool Calling) и поиском (Search-R1)
  • Создание мультимодальных агентов, работающих с текстом и изображениями (Qwen3-VL, Qwen2.5-VL)

Ключевые возможности

  • Алгоритм GiGPO (Group-in-Group Policy Optimization), принятый в NeurIPS 2025
  • Поддержка длинных сценариев (до 50+ шагов) через гибкое управление памятью и историей
  • Широкий спектр RL-алгоритмов: PPO, GRPO, DAPO, RLOO, REINFORCE++ и др.
  • Поддержка современных моделей: Qwen3, Qwen3-VL, LLaMA3.2, а также обучение через LoRA
  • Интеграция с экосистемой: поддержка в ROLL и OpenManus-RL

👤 Кому подойдёт: Исследователи в области AI, разработчики LLM-агентов, инженеры по машинному обучению, работающие с RLHF и обучением агентов.

Релизы

v0.1.0major
🕐 9 мес назад · релиз на GitHub ↗

Релиз v0.1.0: поддержка WebShop, Alfworld, Search-R1, алгоритмов DAPO, RLOO и GiGPO, интеграция с vLLM 0.8.2 и Ray.

  • Added: Добавлена поддержка сред WebShop, Alfworld и Search-R1 (tool-calling).
  • Added: Реализованы алгоритмы оптимизации: DAPO, RLOO, unbiased GiGPO и динамический GiGPO.
  • Added: Интеграция с SGlang и vLLM 0.8.2, а также поддержка Ray для окружений.
  • Added: Добавлен менеджер памяти и конфигурация ресурсов для воркеров окружений.
  • Fixed: Исправлены ошибки в SuccessManager, динамической выборке, усечении и установке WebShop.
  • Deprecated: Удалена поддержка multiprocessing (mp) в окружениях.