Инструменты7 октября 2026 г., 19:17 МСК🤖 Auto

Agent Lightning v1.0: Microsoft открыла RL-фреймворк для обучения агентов

Microsoft Research Asia представила Agent Lightning v1.0 — легкий фреймворк для обучения AI-агентов через Reinforcement Learning, использующий реальные среды развертывания без переписывания кода.

Баннер новости 9128

Исследователи из Microsoft Research Asia представили Agent Lightning v1.0 — полностью открытый фреймворк для обучения AI-агентов методом Reinforcement Learning (RL). Ключевое отличие решения заключается в парадигме Harnessed Agentic RL: обучение происходит на той же самой среде (harness), что используется при развертывании агента. Это устраняет необходимость переписывать логику агента внутри тренировочного фреймворка, что часто приводило к расхождению поведения модели в обучении и на продакшене.

Архитектура и эффективность

Фреймворк спроектирован с упором на минимализм: весь код занимает около 3 500 строк. Архитектура состоит из трех основных компонентов:

  • API Gateway: OpenAI-совместимый прокси, который перехватывает запросы к LLM, сохраняя логи, промпты и лог-вероятности для обучения.
  • Rollout Controller: Управляет выполнением агентов как стандартных Kubernetes-задач, поддерживая как локальные кластеры, так и облачные решения.
  • Customized Trainer: Построен на базе verl, собирает сэмплы и адаптирует их для обучения.

Результаты на SWE-bench Verified

Для демонстрации эффективности команда создала пайплайн для кодингового агента на базе модели Qwen3.5-9B. Использование Agent Lightning позволило достичь значительного прироста качества при минимальных затратах данных:

Метрика До обучения После обучения Прирост
Pass@1 на SWE-bench Verified 41.8% 56.4% +14.6 п.п.
Объем обучающей выборки ~6 000 сэмплов (на основе открытого датасета)

Технические инновации

Работа с реальными harness-ами создает специфические проблемы, такие как ретокенизация и сложность расчета преимуществ (advantage) при разделении одного ролаута на несколько сэмплов. Microsoft решила эти проблемы через:

  • Collocated Async RL: Метод, позволяющий ролауту и обновлению модели делить одни и те же GPU. Это обеспечивает ускорение работы в 2 раза по сравнению с синхронным RL, избегая простоев оборудования.
  • Нативная поддержка Kubernetes: Агенты запускаются как стандартные задачи, что исключает зависимость от платных коммерческих сервисов-песочниц.

Решение позволяет разработчикам интегрировать RL-обучение в существующие агенты (такие как OpenHands, Claude Code или mini-SWE-agent) просто изменив endpoint вызова модели на прокси Agent Lightning.

Источник: Microsoft Research ↗