Проблема закрытых систем и решение Microsoft
Развитие автономных AI-агентов уперлось в инфраструктурный тупик: создание state-of-the-art систем требует проприетарных песочниц, закрытых датасетов и пайплайнов, недоступных широкому сообществу. Microsoft Research решает эту проблему, выпуская Orchard — открытый фреймворк для масштабируемого обучения агентов. В основе лежит Orchard Env, легковесный сервис на базе Kubernetes, который позволяет изолированно запускать тысячи компонентов для сбора данных, reinforcement learning (RL) и оценки.
Ключевое отличие Orchard — возможность обучения агентов непосредственно в тех же «хarness» (оболочках), в которых они будут развернуты. Фреймворк поддерживает Codex, OpenClaw и ZeroClaw, записывая вызовы моделей в реальном времени, что устраняет разрыв между симуляцией и продакшеном.
Orchard-SWE: Прорыв в программировании с малыми моделями
Для задач software engineering (SWE) Microsoft разработала рецепт Orchard-SWE. Модель использует всего ~3 млрд активных параметров, но демонстрирует результаты, сопоставимые с системами, имеющими более 30 млрд параметров. Обучение прошло через несколько этапов:
- Supervised Fine-Tuning (SFT): Использовано 107 000 взаимодействий, дистиллированных из моделей MiniMax-M2.5 и Qwen3.5-397B. Применена техника credit-assignment, позволяющая учиться на частичных успехах, а не только на финальных патчах.
- Reinforcement Learning (RL): Применена Balanced Adaptive Rollout для работы с разреженными сигналами успеха. Добавлены «плотные награды» (dense rewards): он-поллайн дистилляция от сильной модели-учителя и процессная модель вознаграждения, оценивающая логику решения (написание тестов, проверку фиксов).
- Value Model Reranking: Отдельная 4-миллиардная модель обучалась на прошлых rollout-ах для ранжирования кандидатов и выбора лучшего решения.
Результаты и бенчмарки
Итоговые метрики Orchard-SWE на бенчмарке SWE-bench Verified впечатляют. Модель не просто достигла нового SOTA для open-source решений своего размера, но и приблизилась к флагманским проприетарным системам.
| Метрика / Модель | Результат (SWE-bench Verified) | Примечание |
|---|---|---|
| Базовый уровень (Baseline) | 61.4% | Исходная точка обучения |
| Orchard-SWE + Balanced Adaptive Rollout | 69.1% | После RL-шага |
| Orchard-SWE + Dense Rewards | 69.7% | Новый SOTA для ~3B параметров |
| Orchard-SWE + Value Model Reranking | 73.0% | Конкурирует с системами >30B параметров |
Orchard-GUI: Веб-агенты с минимальными данными
Параллельно представлен Orchard-GUI — агент для навигации в браузере на базе 4-миллиардной vision-language модели. Несмотря на ограниченное количество обучающих данных (400 дистиллированных демонстраций и 2 200 открытых задач), модель показала высокую эффективность:
- WebVoyager: 74.1%
- Online-Mind2Web: 67.0%
- DeepShop: 64.0%
- Средний результат: 68.4%
Эти показатели делают Orchard-GUI одним из сильнейших open-source GUI-агентов, сравнимым с решениями от OpenAI и Google. Microsoft также публикует обучающие данные и методы оценки, чтобы стимулировать развитие открытой экосистемы агентов.
Источник: Microsoft Research ↗
