Исследователи из Microsoft Research Asia представили Agent Lightning v1.0 — полностью открытый фреймворк для обучения AI-агентов методом Reinforcement Learning (RL). Ключевое отличие решения заключается в парадигме Harnessed Agentic RL: обучение происходит на той же самой среде (harness), что используется при развертывании агента. Это устраняет необходимость переписывать логику агента внутри тренировочного фреймворка, что часто приводило к расхождению поведения модели в обучении и на продакшене.
Архитектура и эффективность
Фреймворк спроектирован с упором на минимализм: весь код занимает около 3 500 строк. Архитектура состоит из трех основных компонентов:
- API Gateway: OpenAI-совместимый прокси, который перехватывает запросы к LLM, сохраняя логи, промпты и лог-вероятности для обучения.
- Rollout Controller: Управляет выполнением агентов как стандартных Kubernetes-задач, поддерживая как локальные кластеры, так и облачные решения.
- Customized Trainer: Построен на базе verl, собирает сэмплы и адаптирует их для обучения.
Результаты на SWE-bench Verified
Для демонстрации эффективности команда создала пайплайн для кодингового агента на базе модели Qwen3.5-9B. Использование Agent Lightning позволило достичь значительного прироста качества при минимальных затратах данных:
| Метрика | До обучения | После обучения | Прирост |
|---|---|---|---|
| Pass@1 на SWE-bench Verified | 41.8% | 56.4% | +14.6 п.п. |
| Объем обучающей выборки | ~6 000 сэмплов (на основе открытого датасета) | ||
Технические инновации
Работа с реальными harness-ами создает специфические проблемы, такие как ретокенизация и сложность расчета преимуществ (advantage) при разделении одного ролаута на несколько сэмплов. Microsoft решила эти проблемы через:
- Collocated Async RL: Метод, позволяющий ролауту и обновлению модели делить одни и те же GPU. Это обеспечивает ускорение работы в 2 раза по сравнению с синхронным RL, избегая простоев оборудования.
- Нативная поддержка Kubernetes: Агенты запускаются как стандартные задачи, что исключает зависимость от платных коммерческих сервисов-песочниц.
Решение позволяет разработчикам интегрировать RL-обучение в существующие агенты (такие как OpenHands, Claude Code или mini-SWE-agent) просто изменив endpoint вызова модели на прокси Agent Lightning.
Источник: Microsoft Research ↗
