areal-project/AReaL

RL Bridge для приложений на основе LLM-агентов. Просто и гибко.

Агенты⭐ 5 781Pythonпоследний релиз: v2.1.0
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

AReaL — это инфраструктура для асинхронного обучения с подкреплением (RL), предназначенная для настройки больших языковых моделей (LLM) в роли автономных агентов.

Зачем нужен

Инструмент решает задачу эффективного и масштабируемого обучения агентов, объединяя подготовку foundation-моделей с современными агентными приложениями. Он полезен тем, что позволяет оптимизировать стоимость и скорость обучения за счет полностью асинхронной парадигмы, делая процесс создания AI-агентов доступным для широкого круга разработчиков.

Что можно реализовать

  • Обучение агентов для решения математических задач и написания кода (coding/math agents)
  • Создание агентов для поиска информации (search agents) и обслуживания клиентов (customer service)
  • Настройка black-box agent приложений путем простой замены base_url без изменения кода
  • Использование self-evolving data synthesis engine (AReaL-SEA) для синтеза данных и обучения MoE-моделей

Ключевые возможности

  • Полностью асинхронная парадигма обучения, обеспечивающая высокую скорость и стабильность
  • Гибкая настройка agentic RL и online RL training для любых приложений через замену base_url
  • Поддержка обучения на устройствах Ascend NPU
  • Интеграция с NVIDIA TensorRT-LLM Scaffoldings для модульного разделения выполнения агента, расчета награды и сбора траекторий
  • SOTA результаты в задачах математики, кодинга, поиска и клиентского обслуживания

👤 Кому подойдёт: Исследователи и разработчики, занимающиеся созданием и обучением AI-агентов на базе LLM, а также инженеры, ищущие масштабируемые решения для RL-тренинга.

Релизы

v2.1.0minor
🕐 27 дн назад · релиз на GitHub ↗

Релиз AReaL v2.1.0: добавлена поддержка Qwen3.6 LoRA GRPO, HTTP Ray Scheduler и улучшена стабильность обучения.

  • Added: Добавлена поддержка обучения Qwen3.6 (27B и 35B-A3B) через LoRA GRPO.
  • Added: Внедрен HTTP-планировщик Ray для инфраструктуры.
  • Added: Поддержка AWEX colocated actor-rollout обучения и обновление AWEX до версии 0.8.0.
  • Fixed: Исправлена маршрутизация текстовых VLM-микропакетов и синхронизация весов в SGLang.
  • Fixed: Устранена уязвимость SSRF в /register_model и улучшена стабильность роутинга инференса.
v2.0.0majorbreaking
🕐 2 мес назад · релиз на GitHub ↗

AReaL v2.0: микросервисная архитектура, CLI, поддержка Qwen3.5 и новая агентная система Hermes.

  • Added: Полный переход на микросервисную архитектуру с выделением отдельных сервисов для обучения, инференса, агентов и обновления весов.
  • Added: Внедрен единый CLI-интерфейс для запуска и управления всеми микросервисами платформы.
  • Added: Добавлена поддержка обучения и инференса моделей Qwen3.5 (dense и MoE) через megatron-bridge.
  • Added: Представлен пример end-to-end агента Hermes, интегрированного в цикл обучения RL, а также функция он-полайс дистилляции.
  • Added: Оптимизация производительности: параллелизация инициализации контроллеров, асинхронное сохранение весов и CUDA IPC.
  • Fixed: Исправления безопасности (отказ от ключа администратора при небезопасном биндинге), стабильности HTTP-клиента и корректности весов AdamW.