Human-Agent-Society/reef

Инфраструктура для непрерывного обучения самообучающихся агентов

Агенты⭐ 3 800Pythonпоследний релиз: v0.0.2
Открыть на GitHub ↗Сайт проекта ↗

Что это за инструмент

Reef — это инфраструктура для непрерывного обучения (continual learning) AI-агентов, позволяющая им самосовершенствоваться на основе обратной связи от пользователей.

Зачем нужен

Инструмент решает проблему статичности агентов, связывая инференс, сбор обратной связи, обучение и версионирование в единый цикл. Он полезен тем, кто хочет, чтобы модель или её «шорты» (промпты, правила, навыки) улучшались автоматически по мере использования, без необходимости ручного переобучения.

Что можно реализовать

  • Непрерывное дообучение весов LLM (например, Qwen) на основе пользовательских оценок ответов с использованием фреймворков Slime или SGLang.
  • Автоматическая оптимизация агента (harness optimization): улучшение промптов, правил и навыков без локального обучения GPU.
  • Научные открытия через test-time training: использование среды выполнения и проверок корректности для улучшения агента в реальном времени.
  • Поддержка живого трафика (serving) во время процессов обучения и обновления версий артефактов.

Ключевые возможности

  • Поддержка двух поверхностей обучения: обновление весов модели и улучшение агента (harness).
  • Совместимость с OpenAI и Anthropic API (эндпоинты /v1/chat/completions и /v1/messages).
  • Встроенное управление версиями артефактов с использованием Git LFS.
  • Четырехэтапный цикл обучения: Serve (инференс), Observe (сбор фидбека), Grow (генерация обновлений), Commit (применение изменений).
  • Интеграция с популярными фреймворками: vLLM, SGLang, Slime, veRL, AReaL.

👤 Кому подойдёт: разработчики AI-агентов, ML-инженеры, исследователи в области continual learning

Релизы

v0.0.2minor
🕐 19 дн назад · релиз на GitHub ↗

Релиз v0.0.2: новые адаптеры и эволюция хarnессов, исправления стабильности и улучшенная документация.

  • Added: Добавлен адаптер для Claude Code и возможность эволюции хarnессов на основе записанного трафика без явных отчетов.
  • Added: В статусе теперь отображается последний зафиксированный шаг обучения, а также улучшена инкрементальная обработка SSE.
  • Fixed: Исправлено сохранение квитанций (receipts) при перекрывающихся запусках и сохранение причины остановки оркестратора.
  • Added: Рецепты развертывания стали изолированными (deployment-scoped), а CI-процесс настроен на создание релизов через GitHub CLI.
  • Значительно обновлена документация: добавлены инструкции по установке через uv, Colab-ячейки, бейдж PyPI и дорожная карта Q3.